Wichtigste Erkenntnisse
- Dies ist der begleitende Test zum Eintrag von Rapid-MLX im Local LLM Software Directory
- Kostenlos und quelloffen unter Apache 2.0, laut Lizenz-Badge und LICENSE-Datei des Repositorys, geprüft am 18.09.2026
- Nur Apple Silicon (M1–M4) — es existiert keine Windows- oder Linux-Version
- Verwendet native MLX-Kernels statt eines llama.cpp-Wrappers, laut eigener Dokumentation mit kontinuierlichem Batching und int4/int8-quantisiertem KV-Caching
- Multimodal: Textgenerierung, Bildgenerierung (FLUX, SDXL), Video (Wan, CogVideoX, LTX), Audio (TTS, Transkription, Stimmenklonen) und Embeddings
- 3.773 GitHub-Stars und 416 Forks zum Zeitpunkt dieses Tests (18.09.2026); über 2.500 Commits im Main-Branch
- Das GitHub-Repository unter raullenchai/Rapid-MLX ist das Original — mehrere gleichnamige Forks ohne Stars existieren unter anderen Benutzernamen und sind keine eigenständigen Projekte
📍 In einem Satz
Rapid-MLX ist ein kostenloser, quelloffener (Apache 2.0), ausschließlich für macOS verfügbarer lokaler Inferenzserver, der Modelle mit nativen MLX-Kernels ausführt und OpenAI- sowie Anthropic-kompatible Endpunkte für Coding-Agenten wie Claude Code, Cursor, Aider und Cline bereitstellt.
💬 In einfachen Worten
Anstatt Ihren Coding-Agenten an eine Cloud-API weiterzuleiten, führt Rapid-MLX das Modell direkt auf Ihrem Mac mit Apples MLX-Framework aus und spricht dasselbe Anfrageformat wie OpenAI und Anthropic — sodass die meisten Tools, die eine dieser APIs erwarten, einfach mit einer anderen URL darauf zugreifen können.
📌Hinweis: Dieser Test basiert auf dem eigenen GitHub-README und den Repository-Metadaten von Rapid-MLX. Leistungsangaben wie „4,2x schneller als Ollama" sind selbst veröffentlichte Benchmark-Werte des Projekts, keine von PromptQuorum unabhängig gemessenen Zahlen — prüfen Sie die Benchmark-Dokumentation des Repositorys, bevor Sie sich auf einen bestimmten Wert verlassen.
Was ist Rapid-MLX?
Rapid-MLX ist ein lokaler KI-Inferenzserver, der speziell für Apple-Silicon-Macs entwickelt wurde und Apples eigenes MLX-Array-Framework verwendet, statt der llama.cpp-Engine, auf die sich die meisten lokalen LLM-Tools stützen. Es positioniert sich als direkter Ersatz für die OpenAI- und Anthropic-APIs, sodass bestehende Tools und Skripte, die für diese APIs geschrieben wurden, statt eines Cloud-Endpunkts einen lokalen Rapid-MLX-Server ansprechen können.
- Produkttyp: ein Kommandozeilen-Inferenzserver (plus optionale Desktop-App unter rapidmlx.com/desktop) — an sich keine Chat-GUI
- Repository: github.com/raullenchai/Rapid-MLX, bestätigt als Original-Repository — mehrere identisch benannte Forks ohne Stars existieren unter anderen GitHub-Benutzernamen (z. B. xinqiyang/rapid-mlx, LXD-8/Rapid-MLX) und sind reine Forks, keine eigenständigen Projekte, geprüft am 18.09.2026
- Lizenz: Apache 2.0, laut LICENSE-Datei und Lizenz-Badge des Repositorys, geprüft am 18.09.2026
- Plattform: nur macOS auf Apple Silicon (M1-, M2-, M3-, M4-Serie) — dieser Test fand keine Windows- oder Linux-Version im Repository
- Umfang: 3.773 GitHub-Stars, 416 Forks und über 2.500 Commits im Main-Branch zum Zeitpunkt dieses Tests (18.09.2026)
Was macht Rapid-MLX genau?
Rapid-MLX lädt ein Modell mit nativen MLX-Kernels in den Speicher und stellt es über lokale HTTP-Endpunkte bereit, die den OpenAI- und Anthropic-APIs nachempfunden sind, plus Endpunkte für Bild, Video, Audio und Embeddings.
- API-Kompatibilität:
/v1/chat/completionsund/v1/messagesfür Text, plus/v1/audio/*und/v1/videosfür andere Modalitäten, laut README des Repositorys - Native MLX-Ausführung: führt Modelle mit MLX-Kernels statt eines llama.cpp-Fallbacks aus, was laut README kontinuierliches Batching und int4/int8-quantisiertes KV-Caching ermöglicht
- Agenten-Integrationen: Das README dokumentiert verifizierte, Ende-zu-Ende getestete Unterstützung für 5 „Tier-1"-Coding-Agenten — Claude Code, Codex CLI, Hermes, Aider und DeepSeek Harness — sowie breitere Kompatibilität mit Tools wie Cursor und Cline, die das OpenAI/Anthropic-Wire-Format sprechen
- Multimodale Generierung: Bildmodelle (FLUX, SDXL), Videomodelle (Wan, CogVideoX, LTX) und Audio (Text-zu-Sprache, Transkription, Stimmenklonen, erzwungene Ausrichtung — das README listet 44 audiobezogene Aliase)
- Modellkatalog: Das README listet 194 Text-Modell-Aliase mit RAM-Stufen-Empfehlungen von 8-GB-Rechnern bis zu Mac-Studio-Konfigurationen mit 256 GB+
- Leistungsangaben: Das eigene README von Rapid-MLX nennt ein Benchmark-Ergebnis von „4,2x schneller als Ollama" und eine gecachte Zeit bis zum ersten Token von 0,08 Sekunden — dies sind die selbst veröffentlichten Werte des Projekts, keine von diesem Test unabhängig gemessenen Zahlen
Anwendungsbeispiele: Drei Wege, Rapid-MLX zu nutzen
Dies sind konkrete Workflows, die auf der dokumentierten API-Oberfläche von Rapid-MLX basieren, keine hypothetischen Szenarien.
Rapid-MLX installieren
Rapid-MLX lässt sich kostenlos über Homebrew, ein Shell-Installationsskript, uv oder pip installieren — der Quellcode liegt auf GitHub.
Quelle | Link |
|---|---|
| GitHub-Repository (Quellcode, Apache 2.0) | github.com/raullenchai/Rapid-MLX |
| Homebrew | brew install rapid-mlx |
| Shell-Installationsskript | curl -fsSL https://rapidmlx.com/install.sh | bash |
| uv-Paketmanager | uv tool install rapid-mlx@latest |
| pip | python3.12 -m pip install rapid-mlx |
| Desktop-App (macOS) | rapidmlx.com/desktop |
Rapid-MLX benötigt laut README einen Apple-Silicon-Mac und Python 3.10 oder neuer — es gibt keinen Installationsweg für Windows oder Linux, und ältere macOS-Python-Versionen müssen unter Umständen zunächst manuell aktualisiert werden. Prüfen Sie den aktuellen Installationsbefehl im GitHub-Repository, bevor Sie ihn ausführen, da sich Anweisungen zwischen Releases ändern können.
Rapid-MLX Preise und Lizenzierung
Rapid-MLX ist kostenlos, ohne kostenpflichtige Stufe. Es ist unter Apache 2.0 lizenziert, laut LICENSE-Datei und Lizenz-Badge des Repositorys, geprüft am 18.09.2026 — eine freizügige Lizenz, die kommerzielle Nutzung, Modifikation und Weiterverbreitung erlaubt.
- Kein Abonnement, keine kostenpflichtige Stufe, keine von Rapid-MLX selbst auferlegten Nutzungslimits
- Kein Konto oder Registrierung zur Installation oder Nutzung erforderlich
- Wenn Sie Rapid-MLX als Backend für einen kostenpflichtigen Coding-Agenten oder ein IDE-Plugin nutzen, gilt weiterhin die eigene Preisgestaltung dieses Tools (falls vorhanden) — Rapid-MLX selbst berechnet keine zusätzliche Gebühr
- Größere Modelle laufen zu lassen, hat weiterhin Hardwarekosten: größere Modelle benötigen mehr Unified Memory, und ein im README dokumentierter experimenteller DeepSeek-V4-REAP-Modus benötigt 224 GB+ Unified Memory
Rapid-MLX vs. Ollama
Rapid-MLX und Ollama sind beide kostenlose lokale Inferenzserver, zielen aber auf unterschiedliche Einsatzbereiche ab: Rapid-MLX ist nur für Apple Silicon verfügbar und nutzt native MLX-Kernels, während Ollama plattformübergreifend auf einem llama.cpp-basierten Backend läuft.
Plattformunterstützung
- Rapid-MLX:
- Nur macOS auf Apple Silicon
- Ollama:
- macOS, Windows und Linux
Inferenz-Engine
- Rapid-MLX:
- Native MLX-Kernels
- Ollama:
- llama.cpp-basiert (GGUF-Modelle)
API-Kompatibilität
- Rapid-MLX:
- OpenAI- + Anthropic-Wire-Formate
- Ollama:
- Eigene API plus OpenAI-kompatibler Modus
Unterstützte Modalitäten
- Rapid-MLX:
- Text, Bild, Video, Audio, Embeddings
- Ollama:
- Text und vision-fähige Chat-Modelle
Leistungsangabe
- Rapid-MLX:
- README nennt 4,2x schneller als Ollama (Herstellerangabe)
- Ollama:
- Keine vergleichbare veröffentlichte Angabe gefunden
Der Wert „4,2x schneller" ist eine selbst veröffentlichte Benchmark-Angabe von Rapid-MLX, keine von diesem Test unabhängig reproduzierte Zahl — wenn der reine Durchsatz auf Ihrer konkreten Hardware und Ihrem Modell für Ihre Entscheidung wichtig ist, testen Sie beide Tools selbst, bevor Sie sich entscheiden. Falls Sie überhaupt Windows- oder Linux-Unterstützung benötigen, ist Ollama von den beiden das einzige, das dies bietet.
Für wen eignet sich Rapid-MLX?
Rapid-MLX eignet sich für Besitzer von Apple-Silicon-Macs, die einen nativen, API-kompatiblen lokalen Inferenzserver für Coding-Agenten oder multimodale Workflows suchen, statt eines plattformübergreifenden Tools.
Wofür Rapid-MLX nicht geeignet ist
Rapid-MLX ist außerhalb von Apple Silicon keine gute Wahl und an sich keine grafische Chat-Anwendung.
- Nicht für Windows- oder Linux-Nutzer — für keine der beiden Plattformen existiert eine Version, und dieser Test fand keine Roadmap-Zusage, eine hinzuzufügen
- Keine Chat-GUI — es handelt sich um einen Server; Sie verbinden entweder einen kompatiblen Client/Agenten oder nutzen die separate Desktop-App unter rapidmlx.com/desktop
- Nicht garantiert, auf jeder Maschine die selbst veröffentlichte Angabe „4,2x schneller als Ollama" zu erreichen — die eigenen Benchmarks des READMEs zeigen 3–5x Durchsatzunterschiede zwischen einem M2 Pro 32 GB und einem M3 Ultra 256 GB, die Ergebnisse skalieren also mit der Hardware
- Nicht geeignet für mehrere gleichzeitige Bild- oder Videogenerierungs-Jobs — das README dokumentiert eine Single-Flight-Generierung für diese Modalitäten, um Speichererschöpfung zu vermeiden
- Keine von diesem Test verifizierbare Finanzierungsrunde oder Unternehmensbeteiligung — betrachten Sie es als unabhängig gepflegtes, communitygetragenes Projekt
Häufige Fehler bei der Bewertung von Rapid-MLX
Die meiste Verwirrung rund um Rapid-MLX entsteht durch Verwechslung mit gleichnamigen Forks oder die Annahme, es funktioniere auch außerhalb von Apple Silicon.
Wettbewerber und Alternativen
Rapid-MLX wird am häufigsten mit anderen Apple-Silicon-fokussierten Inferenz-Tools und plattformübergreifenden Servern wie oMLX, Ollama und LM Studio verglichen — sein Hauptunterscheidungsmerkmal ist die native MLX-Ausführung mit OpenAI/Anthropic-kompatiblen Endpunkten, speziell für Coding-Agenten-Backends entwickelt.
Tool | Bekannt für | Link |
|---|---|---|
| oMLX | Ein weiteres MLX-basiertes lokales Inferenz-Tool für Apple Silicon | oMLX Test |
| Ollama | Plattformübergreifender, llama.cpp-basierter lokaler Modellserver mit großer Modellbibliothek | Ollama Test |
| LM Studio | Desktop-GUI zum Ausführen lokaler Modelle, mit MLX-Engine-Option auf Apple Silicon | LM Studio Test |
Diese Liste spiegelt Tools wider, die häufig mit Rapid-MLX verglichen werden, keine unabhängige Rangfolge von PromptQuorum — prüfen Sie die aktuelle Plattformunterstützung und den Funktionsumfang jedes Tools, bevor Sie sich entscheiden.
Häufig gestellte Fragen
Was ist Rapid-MLX?
Rapid-MLX (github.com/raullenchai/Rapid-MLX) ist ein kostenloser, quelloffener (Apache 2.0) lokaler Inferenzserver für Apple-Silicon-Macs, der Modelle mit nativen MLX-Kernels ausführt und OpenAI- sowie Anthropic-kompatible API-Endpunkte bereitstellt.
Ist Rapid-MLX kostenlos?
Ja. Rapid-MLX ist kostenlos und quelloffen unter Apache 2.0, ohne kostenpflichtige Stufe, Abonnement oder vom Projekt selbst auferlegte Nutzungslimits.
Läuft Rapid-MLX unter Windows oder Linux?
Nein. Rapid-MLX unterstützt nur Apple-Silicon-Macs (M1 bis M4). Dieser Test fand im Repository keine Windows- oder Linux-Version.
Wie installiere ich Rapid-MLX?
Laut README des Repositorys über Homebrew (brew install rapid-mlx), ein Shell-Installationsskript (curl -fsSL https://rapidmlx.com/install.sh | bash), uv (uv tool install rapid-mlx@latest) oder pip (python3.12 -m pip install rapid-mlx). Eine Desktop-App ist zudem unter rapidmlx.com/desktop verfügbar.
Welche Coding-Agenten funktionieren mit Rapid-MLX?
Das README dokumentiert verifizierte, Ende-zu-Ende getestete Unterstützung für Claude Code, Codex CLI, Hermes, Aider und DeepSeek Harness, sowie breitere Kompatibilität mit jedem Tool, das das OpenAI- oder Anthropic-API-Format spricht, etwa Cursor und Cline.
Ist Rapid-MLX tatsächlich 4,2x schneller als Ollama?
Diese Zahl stammt aus den selbst veröffentlichten README-Benchmarks von Rapid-MLX, nicht aus einer unabhängigen Messung von PromptQuorum. Wenn der genaue Durchsatz für Ihre Entscheidung wichtig ist, testen Sie beide Tools selbst auf Ihrer eigenen Hardware mit Ihrem eigenen Modell.
Kann Rapid-MLX Bilder, Video oder Audio generieren?
Ja. Neben Text dokumentiert das README Endpunkte für Bildgenerierung (FLUX, SDXL), Videogenerierung (Wan, CogVideoX, LTX) und Audio (Text-zu-Sprache, Transkription, Stimmenklonen).
Wie viel RAM benötigt Rapid-MLX?
Das hängt vollständig vom geladenen Modell ab. Das README listet 194 Text-Modell-Aliase mit RAM-Stufen-Empfehlungen von 8-GB-Rechnern bis zu Mac-Studio-Konfigurationen mit 256 GB+ — prüfen Sie die angegebene Anforderung eines bestimmten Modells, bevor Sie es herunterladen.
Unter welcher Lizenz steht Rapid-MLX?
Apache 2.0, laut LICENSE-Datei und Lizenz-Badge des Repositorys, geprüft am 18.09.2026. Es handelt sich um eine freizügige Lizenz, die kommerzielle Nutzung, Modifikation und Weiterverbreitung erlaubt.
Ist raullenchai/Rapid-MLX das echte Repository?
Ja. Mehrere identisch benannte Forks ohne Stars existieren unter anderen GitHub-Benutzernamen, aber raullenchai/Rapid-MLX ist das Original mit den meisten Stars und der frühesten Erstellung, geprüft am 18.09.2026.