Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Rapid-MLX im Test: Nativer MLX-Inferenzserver für Apple Silicon
Overview & Reference

Rapid-MLX im Test: Nativer MLX-Inferenzserver für Apple Silicon

·10 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Rapid-MLX ist ein kostenloser, quelloffener Inferenzserver ausschließlich für Apple Silicon, der Modelle mit nativen MLX-Kernels ausführt und OpenAI- sowie Anthropic-kompatible API-Endpunkte bereitstellt, sodass Coding-Agenten wie Claude Code, Cursor, Aider und Cline ihn anstelle einer Cloud-API als lokales Backend nutzen können. Es ist nur für macOS verfügbar (Apple Silicon M1 bis M4), Apache-2.0-lizenziert und lässt sich über Homebrew, ein Shell-Installationsskript, uv oder pip installieren — es gibt keine Windows- oder Linux-Version.

Rapid-MLX (github.com/raullenchai/Rapid-MLX) ist eine kostenlose Open-Source-Inferenz-Engine speziell für Apple-Silicon-Macs, mit 3.773 GitHub-Stars zum Zeitpunkt dieses Tests. Sie führt Modelle mit nativen MLX-Kernels aus, anstatt llama.cpp zu umhüllen, und stellt OpenAI- und Anthropic-kompatible API-Endpunkte bereit, sodass Tools wie Claude Code, Cursor, Aider und Cline sie als direktes lokales Backend nutzen können. Dieser Test beleuchtet, was Rapid-MLX tatsächlich leistet, wie die Installation abläuft und für wen es geeignet ist.

Wichtigste Erkenntnisse

  • Dies ist der begleitende Test zum Eintrag von Rapid-MLX im Local LLM Software Directory
  • Kostenlos und quelloffen unter Apache 2.0, laut Lizenz-Badge und LICENSE-Datei des Repositorys, geprüft am 18.09.2026
  • Nur Apple Silicon (M1–M4) — es existiert keine Windows- oder Linux-Version
  • Verwendet native MLX-Kernels statt eines llama.cpp-Wrappers, laut eigener Dokumentation mit kontinuierlichem Batching und int4/int8-quantisiertem KV-Caching
  • Multimodal: Textgenerierung, Bildgenerierung (FLUX, SDXL), Video (Wan, CogVideoX, LTX), Audio (TTS, Transkription, Stimmenklonen) und Embeddings
  • 3.773 GitHub-Stars und 416 Forks zum Zeitpunkt dieses Tests (18.09.2026); über 2.500 Commits im Main-Branch
  • Das GitHub-Repository unter raullenchai/Rapid-MLX ist das Original — mehrere gleichnamige Forks ohne Stars existieren unter anderen Benutzernamen und sind keine eigenständigen Projekte

📍 In einem Satz

Rapid-MLX ist ein kostenloser, quelloffener (Apache 2.0), ausschließlich für macOS verfügbarer lokaler Inferenzserver, der Modelle mit nativen MLX-Kernels ausführt und OpenAI- sowie Anthropic-kompatible Endpunkte für Coding-Agenten wie Claude Code, Cursor, Aider und Cline bereitstellt.

💬 In einfachen Worten

Anstatt Ihren Coding-Agenten an eine Cloud-API weiterzuleiten, führt Rapid-MLX das Modell direkt auf Ihrem Mac mit Apples MLX-Framework aus und spricht dasselbe Anfrageformat wie OpenAI und Anthropic — sodass die meisten Tools, die eine dieser APIs erwarten, einfach mit einer anderen URL darauf zugreifen können.

📌Hinweis: Dieser Test basiert auf dem eigenen GitHub-README und den Repository-Metadaten von Rapid-MLX. Leistungsangaben wie „4,2x schneller als Ollama" sind selbst veröffentlichte Benchmark-Werte des Projekts, keine von PromptQuorum unabhängig gemessenen Zahlen — prüfen Sie die Benchmark-Dokumentation des Repositorys, bevor Sie sich auf einen bestimmten Wert verlassen.

Was ist Rapid-MLX?

Rapid-MLX ist ein lokaler KI-Inferenzserver, der speziell für Apple-Silicon-Macs entwickelt wurde und Apples eigenes MLX-Array-Framework verwendet, statt der llama.cpp-Engine, auf die sich die meisten lokalen LLM-Tools stützen. Es positioniert sich als direkter Ersatz für die OpenAI- und Anthropic-APIs, sodass bestehende Tools und Skripte, die für diese APIs geschrieben wurden, statt eines Cloud-Endpunkts einen lokalen Rapid-MLX-Server ansprechen können.

  • Produkttyp: ein Kommandozeilen-Inferenzserver (plus optionale Desktop-App unter rapidmlx.com/desktop) — an sich keine Chat-GUI
  • Repository: github.com/raullenchai/Rapid-MLX, bestätigt als Original-Repository — mehrere identisch benannte Forks ohne Stars existieren unter anderen GitHub-Benutzernamen (z. B. xinqiyang/rapid-mlx, LXD-8/Rapid-MLX) und sind reine Forks, keine eigenständigen Projekte, geprüft am 18.09.2026
  • Lizenz: Apache 2.0, laut LICENSE-Datei und Lizenz-Badge des Repositorys, geprüft am 18.09.2026
  • Plattform: nur macOS auf Apple Silicon (M1-, M2-, M3-, M4-Serie) — dieser Test fand keine Windows- oder Linux-Version im Repository
  • Umfang: 3.773 GitHub-Stars, 416 Forks und über 2.500 Commits im Main-Branch zum Zeitpunkt dieses Tests (18.09.2026)

Was macht Rapid-MLX genau?

Rapid-MLX lädt ein Modell mit nativen MLX-Kernels in den Speicher und stellt es über lokale HTTP-Endpunkte bereit, die den OpenAI- und Anthropic-APIs nachempfunden sind, plus Endpunkte für Bild, Video, Audio und Embeddings.

  • API-Kompatibilität: /v1/chat/completions und /v1/messages für Text, plus /v1/audio/* und /v1/videos für andere Modalitäten, laut README des Repositorys
  • Native MLX-Ausführung: führt Modelle mit MLX-Kernels statt eines llama.cpp-Fallbacks aus, was laut README kontinuierliches Batching und int4/int8-quantisiertes KV-Caching ermöglicht
  • Agenten-Integrationen: Das README dokumentiert verifizierte, Ende-zu-Ende getestete Unterstützung für 5 „Tier-1"-Coding-Agenten — Claude Code, Codex CLI, Hermes, Aider und DeepSeek Harness — sowie breitere Kompatibilität mit Tools wie Cursor und Cline, die das OpenAI/Anthropic-Wire-Format sprechen
  • Multimodale Generierung: Bildmodelle (FLUX, SDXL), Videomodelle (Wan, CogVideoX, LTX) und Audio (Text-zu-Sprache, Transkription, Stimmenklonen, erzwungene Ausrichtung — das README listet 44 audiobezogene Aliase)
  • Modellkatalog: Das README listet 194 Text-Modell-Aliase mit RAM-Stufen-Empfehlungen von 8-GB-Rechnern bis zu Mac-Studio-Konfigurationen mit 256 GB+
  • Leistungsangaben: Das eigene README von Rapid-MLX nennt ein Benchmark-Ergebnis von „4,2x schneller als Ollama" und eine gecachte Zeit bis zum ersten Token von 0,08 Sekunden — dies sind die selbst veröffentlichten Werte des Projekts, keine von diesem Test unabhängig gemessenen Zahlen

Anwendungsbeispiele: Drei Wege, Rapid-MLX zu nutzen

Dies sind konkrete Workflows, die auf der dokumentierten API-Oberfläche von Rapid-MLX basieren, keine hypothetischen Szenarien.

Rapid-MLX Preise und Lizenzierung

Rapid-MLX ist kostenlos, ohne kostenpflichtige Stufe. Es ist unter Apache 2.0 lizenziert, laut LICENSE-Datei und Lizenz-Badge des Repositorys, geprüft am 18.09.2026 — eine freizügige Lizenz, die kommerzielle Nutzung, Modifikation und Weiterverbreitung erlaubt.

  • Kein Abonnement, keine kostenpflichtige Stufe, keine von Rapid-MLX selbst auferlegten Nutzungslimits
  • Kein Konto oder Registrierung zur Installation oder Nutzung erforderlich
  • Wenn Sie Rapid-MLX als Backend für einen kostenpflichtigen Coding-Agenten oder ein IDE-Plugin nutzen, gilt weiterhin die eigene Preisgestaltung dieses Tools (falls vorhanden) — Rapid-MLX selbst berechnet keine zusätzliche Gebühr
  • Größere Modelle laufen zu lassen, hat weiterhin Hardwarekosten: größere Modelle benötigen mehr Unified Memory, und ein im README dokumentierter experimenteller DeepSeek-V4-REAP-Modus benötigt 224 GB+ Unified Memory

Rapid-MLX vs. Ollama

Rapid-MLX und Ollama sind beide kostenlose lokale Inferenzserver, zielen aber auf unterschiedliche Einsatzbereiche ab: Rapid-MLX ist nur für Apple Silicon verfügbar und nutzt native MLX-Kernels, während Ollama plattformübergreifend auf einem llama.cpp-basierten Backend läuft.

Plattformunterstützung

Rapid-MLX:
Nur macOS auf Apple Silicon
Ollama:
macOS, Windows und Linux

Inferenz-Engine

Rapid-MLX:
Native MLX-Kernels
Ollama:
llama.cpp-basiert (GGUF-Modelle)

API-Kompatibilität

Rapid-MLX:
OpenAI- + Anthropic-Wire-Formate
Ollama:
Eigene API plus OpenAI-kompatibler Modus

Unterstützte Modalitäten

Rapid-MLX:
Text, Bild, Video, Audio, Embeddings
Ollama:
Text und vision-fähige Chat-Modelle

Leistungsangabe

Rapid-MLX:
README nennt 4,2x schneller als Ollama (Herstellerangabe)
Ollama:
Keine vergleichbare veröffentlichte Angabe gefunden

Der Wert „4,2x schneller" ist eine selbst veröffentlichte Benchmark-Angabe von Rapid-MLX, keine von diesem Test unabhängig reproduzierte Zahl — wenn der reine Durchsatz auf Ihrer konkreten Hardware und Ihrem Modell für Ihre Entscheidung wichtig ist, testen Sie beide Tools selbst, bevor Sie sich entscheiden. Falls Sie überhaupt Windows- oder Linux-Unterstützung benötigen, ist Ollama von den beiden das einzige, das dies bietet.

Für wen eignet sich Rapid-MLX?

Rapid-MLX eignet sich für Besitzer von Apple-Silicon-Macs, die einen nativen, API-kompatiblen lokalen Inferenzserver für Coding-Agenten oder multimodale Workflows suchen, statt eines plattformübergreifenden Tools.

Wofür Rapid-MLX nicht geeignet ist

Rapid-MLX ist außerhalb von Apple Silicon keine gute Wahl und an sich keine grafische Chat-Anwendung.

  • Nicht für Windows- oder Linux-Nutzer — für keine der beiden Plattformen existiert eine Version, und dieser Test fand keine Roadmap-Zusage, eine hinzuzufügen
  • Keine Chat-GUI — es handelt sich um einen Server; Sie verbinden entweder einen kompatiblen Client/Agenten oder nutzen die separate Desktop-App unter rapidmlx.com/desktop
  • Nicht garantiert, auf jeder Maschine die selbst veröffentlichte Angabe „4,2x schneller als Ollama" zu erreichen — die eigenen Benchmarks des READMEs zeigen 3–5x Durchsatzunterschiede zwischen einem M2 Pro 32 GB und einem M3 Ultra 256 GB, die Ergebnisse skalieren also mit der Hardware
  • Nicht geeignet für mehrere gleichzeitige Bild- oder Videogenerierungs-Jobs — das README dokumentiert eine Single-Flight-Generierung für diese Modalitäten, um Speichererschöpfung zu vermeiden
  • Keine von diesem Test verifizierbare Finanzierungsrunde oder Unternehmensbeteiligung — betrachten Sie es als unabhängig gepflegtes, communitygetragenes Projekt

Häufige Fehler bei der Bewertung von Rapid-MLX

Die meiste Verwirrung rund um Rapid-MLX entsteht durch Verwechslung mit gleichnamigen Forks oder die Annahme, es funktioniere auch außerhalb von Apple Silicon.

Wettbewerber und Alternativen

Rapid-MLX wird am häufigsten mit anderen Apple-Silicon-fokussierten Inferenz-Tools und plattformübergreifenden Servern wie oMLX, Ollama und LM Studio verglichen — sein Hauptunterscheidungsmerkmal ist die native MLX-Ausführung mit OpenAI/Anthropic-kompatiblen Endpunkten, speziell für Coding-Agenten-Backends entwickelt.

Tool
Bekannt für
Link
oMLXEin weiteres MLX-basiertes lokales Inferenz-Tool für Apple SiliconoMLX Test
OllamaPlattformübergreifender, llama.cpp-basierter lokaler Modellserver mit großer ModellbibliothekOllama Test
LM StudioDesktop-GUI zum Ausführen lokaler Modelle, mit MLX-Engine-Option auf Apple SiliconLM Studio Test

Diese Liste spiegelt Tools wider, die häufig mit Rapid-MLX verglichen werden, keine unabhängige Rangfolge von PromptQuorum — prüfen Sie die aktuelle Plattformunterstützung und den Funktionsumfang jedes Tools, bevor Sie sich entscheiden.

Häufig gestellte Fragen

Was ist Rapid-MLX?

Rapid-MLX (github.com/raullenchai/Rapid-MLX) ist ein kostenloser, quelloffener (Apache 2.0) lokaler Inferenzserver für Apple-Silicon-Macs, der Modelle mit nativen MLX-Kernels ausführt und OpenAI- sowie Anthropic-kompatible API-Endpunkte bereitstellt.

Ist Rapid-MLX kostenlos?

Ja. Rapid-MLX ist kostenlos und quelloffen unter Apache 2.0, ohne kostenpflichtige Stufe, Abonnement oder vom Projekt selbst auferlegte Nutzungslimits.

Läuft Rapid-MLX unter Windows oder Linux?

Nein. Rapid-MLX unterstützt nur Apple-Silicon-Macs (M1 bis M4). Dieser Test fand im Repository keine Windows- oder Linux-Version.

Wie installiere ich Rapid-MLX?

Laut README des Repositorys über Homebrew (brew install rapid-mlx), ein Shell-Installationsskript (curl -fsSL https://rapidmlx.com/install.sh | bash), uv (uv tool install rapid-mlx@latest) oder pip (python3.12 -m pip install rapid-mlx). Eine Desktop-App ist zudem unter rapidmlx.com/desktop verfügbar.

Welche Coding-Agenten funktionieren mit Rapid-MLX?

Das README dokumentiert verifizierte, Ende-zu-Ende getestete Unterstützung für Claude Code, Codex CLI, Hermes, Aider und DeepSeek Harness, sowie breitere Kompatibilität mit jedem Tool, das das OpenAI- oder Anthropic-API-Format spricht, etwa Cursor und Cline.

Ist Rapid-MLX tatsächlich 4,2x schneller als Ollama?

Diese Zahl stammt aus den selbst veröffentlichten README-Benchmarks von Rapid-MLX, nicht aus einer unabhängigen Messung von PromptQuorum. Wenn der genaue Durchsatz für Ihre Entscheidung wichtig ist, testen Sie beide Tools selbst auf Ihrer eigenen Hardware mit Ihrem eigenen Modell.

Kann Rapid-MLX Bilder, Video oder Audio generieren?

Ja. Neben Text dokumentiert das README Endpunkte für Bildgenerierung (FLUX, SDXL), Videogenerierung (Wan, CogVideoX, LTX) und Audio (Text-zu-Sprache, Transkription, Stimmenklonen).

Wie viel RAM benötigt Rapid-MLX?

Das hängt vollständig vom geladenen Modell ab. Das README listet 194 Text-Modell-Aliase mit RAM-Stufen-Empfehlungen von 8-GB-Rechnern bis zu Mac-Studio-Konfigurationen mit 256 GB+ — prüfen Sie die angegebene Anforderung eines bestimmten Modells, bevor Sie es herunterladen.

Unter welcher Lizenz steht Rapid-MLX?

Apache 2.0, laut LICENSE-Datei und Lizenz-Badge des Repositorys, geprüft am 18.09.2026. Es handelt sich um eine freizügige Lizenz, die kommerzielle Nutzung, Modifikation und Weiterverbreitung erlaubt.

Ist raullenchai/Rapid-MLX das echte Repository?

Ja. Mehrere identisch benannte Forks ohne Stars existieren unter anderen GitHub-Benutzernamen, aber raullenchai/Rapid-MLX ist das Original mit den meisten Stars und der frühesten Erstellung, geprüft am 18.09.2026.

Quellen

← Zurück zu Lokale LLMs Pro