Wichtigste Erkenntnisse
- mlx-serve ist kostenlos und quelloffen; die offizielle LICENSE-Datei auf GitHub ist die MIT-Lizenz, mit einigen mitgelieferten Drittkomponenten unter der Apache License 2.0
- Läuft nativ auf Apple Silicon über MLX für unterstützte Modellfamilien und über ein eingebettetes llama.cpp für GGUF-Modelle
- Bedient OpenAI-kompatible Chat/Completions- und Responses-APIs, die Anthropic Messages API und die Ollama-API gleichzeitig auf einem Port
- Liefert eine gebündelte macOS-Menüleisten-Begleit-App, MLX Core, mit Multi-Session-Chat, Agentenmodus mit MCP-Tool-Unterstützung und Bild-/Video-/Musik-/Sprach-/3D-Generierungs-Panels mit
- Einzelne ~7-MB-Binärdatei ohne Python-Laufzeitabhängigkeit
- Vorkonfigurierte Launcher für Coding-Agenten, darunter Claude Code, OpenCode und Cursor
- Erfordert macOS 26.2 oder neuer auf Apple-Silicon-Hardware (M-Serie) — keine Unterstützung für Windows, Linux oder Intel-Macs
- Entwickelt von David Dalcu; liefert Stand dieser Review nahezu tägliche getaggte Releases
📍 In einem Satz
mlx-serve ist ein kostenloser, quelloffener Zig-Inferenzserver für Apple-Silicon-Macs, der OpenAI-, Anthropic- und Ollama-kompatible APIs aus einer einzigen Binärdatei bereitstellt, ganz ohne kostenpflichtige Stufe.
💬 In einfachen Worten
Statt Python und mehrere separate Pakete zu installieren, um einen lokalen Modellserver zu betreiben, ist mlx-serve ein kleines Programm, das mit Homebrew installiert wird. Es führt Modelle direkt über Apples MLX-Framework aus oder, bei GGUF-Modellen, über eine eingebettete Kopie von llama.cpp, und beantwortet Anfragen im selben Format, das OpenAI, Anthropic und Ollama verwenden — Tools, die bereits für diese APIs gebaut wurden, funktionieren also ohne Änderungen gegen mlx-serve.
📌Hinweis: Diese Review ist das vertiefende Begleitstück zum Eintrag von mlx-serve im lokalen KI-Software-Verzeichnis — dort finden Sie einen schnellen Überblick, wie mlx-serve im Vergleich zu Dutzenden anderer lokaler KI-Tools abschneidet.
Was ist mlx-serve?
mlx-serve ist ein nativer Inferenzserver für Apple-Silicon-Macs, der KI-Modelle lokal ausführt und über OpenAI-, Anthropic- und Ollama-kompatible APIs bereitstellt. Die eigene GitHub-Beschreibung lautet: "Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling." Der Server selbst ist in Zig geschrieben, einer Systemprogrammiersprache — deshalb wird er als einzelne kleine Binärdatei ausgeliefert statt als Python-Anwendung mit zu installierenden Abhängigkeiten.
- Kernfunktion: ein lokaler Inferenzserver, der ein Modell einmal lädt und gleichzeitig in drei verschiedenen API-Formaten über HTTP bereitstellt
- Natives Modell-Dispatch: MLX — Apples eigenes Array-Computing-Framework für Apple Silicon — für unterstützte Modellfamilien, sowie ein eingebettetes llama.cpp für Modelle im GGUF-Format
- API-Kompatibilität: OpenAI-Chat/Completions- und Responses-Endpunkte, die Anthropic Messages API und die Ollama-API, standardmäßig alle auf Port 11234
- Begleit-App: MLX Core, eine gebündelte macOS-Menüleisten-Anwendung für Chat, Agenten-Workflows und Medien-Generierung, installiert als separates Homebrew-Cask neben dem Server
- Entwickler: David Dalcu, ein Einzelentwickler laut Copyright-Hinweis in der LICENSE-Datei des GitHub-Repositorys
- Kanonisches Repository: github.com/ddalcu/mlx-serve — das Originalprojekt; mehrere Forks und mindestens ein unabhängiges, anders verfasstes Projekt teilen einen ähnlichen Namen — prüfen Sie, dass Sie speziell auf dieses Repository verweisen
mlx-serve Release-Historie
Das GitHub-Repository von mlx-serve wurde im Februar 2026 angelegt, und das Projekt liefert seither nahezu tägliche getaggte Releases mit spekulativem Decoding, Launchern für Coding-Agenten und erweiterter Medien-Generierung. Es handelt sich um ein junges, sich schnell entwickelndes Projekt und nicht um ein ausgereiftes mit langer Erfolgsgeschichte — das sollte in jede Bewertung einfließen.
- 1v26.8.9 — 18. August 2026: Launcher für Coding-Agenten
Why it matters: Fügte laut Release Notes ("launch your coding agent") vorkonfigurierte Launcher für Coding-Agenten hinzu, zusammen mit reichhaltigerem Chat und schnellerem Decoding, laut der [offiziellen Releases-Seite](https://github.com/ddalcu/mlx-serve/releases). - 2v26.8.10 — 26. August 2026: Neural-Engine-Prefill-Offload
Why it matters: Fügte Neural-Engine-Prefill-Offload und batched Decoding hinzu — eine Optimierung, die einen Teil der Inferenz-Pipeline auf Apples dedizierte Neural-Engine-Hardware auslagert. - 3v26.8.11 — 29. August 2026: MLX 0.32.2 und Qwen 3.8 Flash Next
Why it matters: Aktualisierte die mitgelieferte MLX-Framework-Version und fügte Unterstützung für eine neuere Qwen-Modellvariante hinzu. - 4v26.9.1 — 3. September 2026: 1M-Kontext und schnelleres Flash-Decoding
Why it matters: Fügte Terminals in der Seitenleiste der MLX-Core-Begleit-App hinzu, plus Unterstützung für ein Kontextfenster von 1 Million Token bei kompatiblen Modellen. - 5v26.9.2 — 9. September 2026: Pro-Modell-Einstellungen und Chat-Provider
Why it matters: Fügte modellbezogene Konfiguration und zusätzliche Chat-Provider-Optionen hinzu, plus weitere Verbesserungen der Decoding-Geschwindigkeit. - 6v26.9.3 — 16. September 2026: Spekulatives Decoding für alle Modelle
Why it matters: Erweiterte laut Release Notes die Unterstützung für spekulatives Decoding über eine eingeschränkte Modellauswahl hinaus, zusammen mit Performance-Arbeit für Flash auf 64-GB-Macs. - 7v26.9.4 — 17. September 2026: Korrektheits-Fixes und Benchmarks
Why it matters: Lieferte Korrektheits-Fixes, fügte chinesischsprachige Dokumentation hinzu und veröffentlichte neue Benchmark-Zahlen — der aktuellste stabile Tag, der Stand dieser Review auf der [offiziellen Releases-Seite](https://github.com/ddalcu/mlx-serve/releases) verzeichnet ist.
Was kann man mit mlx-serve tun?
Der Funktionsumfang von mlx-serve konzentriert sich darauf, Modelle schnell auf Apple Silicon bereitzustellen und dabei kompatibel mit Tools zu bleiben, die bereits für andere APIs gebaut wurden. Hier ist, was jeder Teil laut GitHub-README des Projekts tatsächlich leistet.
- Multi-API-Bereitstellung — der Server beantwortet OpenAI-Chat/Completions- und Responses-Anfragen, Anthropic-Messages-API-Anfragen und Ollama-API-Anfragen gleichzeitig auf demselben Port, sodass bestehender OpenAI-/Anthropic-/Ollama-Client-Code nur mit einer Basis-URL-Änderung auf mlx-serve zeigen kann
- Natives MLX-Modell-Dispatch — Modelle mit nativer MLX-Unterstützung (laut README: Gemma, Qwen, Llama, Mistral und DeepSeek V4 Flash) laufen direkt über Apples MLX-Framework auf Apple Silicon
- Eingebettetes llama.cpp für GGUF — Tausende von GGUF-formatigen Modellen, die nicht nativ von MLX unterstützt werden, laufen stattdessen über eine eingebettete Kopie von llama.cpp, ohne separate Installation
- Performance-Funktionen — das README dokumentiert vier Varianten von spekulativem Decoding, kontinuierliches Batching, KV-Cache-Quantisierung und angepasste Metal-Kernel, ausgerichtet auf Durchsatz auf Apple Silicon
- MLX-Core-Begleit-App — eine gebündelte macOS-Menüleisten-Anwendung mit Multi-Session-Chat inklusive PDF-/Bildanhängen, einem Agentenmodus mit integrierten Tools und Model-Context-Protocol-(MCP)-Marktplatz-Integration, einer isolierten Agent Sandbox zum Ausführen von Shell-Befehlen, einem Modell-Browser mit fortsetzbaren Downloads sowie Generierungs-Panels für Bilder, Video, Musik, Sprache (inklusive Voice Cloning mit Kokoro-Stimmen) und 3D-Modelle
- Launcher für Coding-Agenten — vorkonfigurierte Launch-Profile für Coding-Agenten wie Claude Code, OpenCode, Pi und Cursor, laut Release Notes
- Keine Python-Abhängigkeit — die Server-Binärdatei ist rund 7 MB groß und benötigt keine Python-Laufzeitumgebung, im Gegensatz zu vielen anderen lokalen Inferenz-Tools
Anwendungsbeispiele: Drei Wege, mlx-serve zu nutzen
Dies sind konkrete Workflows, die auf den oben dokumentierten Befehlen von mlx-serve basieren — keine hypothetischen Anwendungsfälle.
mlx-serve installieren
mlx-serve wird über Homebrew installiert, der Quellcode liegt auf GitHub. Die Links unten stammen aus dem offiziellen GitHub-README — prüfen Sie diese Seite immer direkt, da sich Installationsanweisungen zwischen Releases ändern können.
Server (Homebrew)
- Link:
brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-servedannbrew install mlx-serve
MLX-Core-Begleit-App (Homebrew-Cask)
- Link:
brew install --cask mlx-core
GitHub-Repository (Quellcode, MIT-Lizenz)
Projekt-Homepage
- Link:
- mlxserve.com
Aus dem Quellcode bauen
- Link:
- Erfordert Xcode 26.2+ mit der Metal-Toolchain-Komponente, laut GitHub-README
Die mitgelieferte MLX-Core-Menüleisten-App ist eine Begleit-App, nicht der primäre Installationsweg — mlx-serve ist im Kern ein Kommandozeilen-Server, und MLX Core ist ein optionales grafisches Frontend dafür. mlx-serve erfordert macOS 26.2 oder neuer auf Apple Silicon; es läuft nicht auf Intel-Macs, Windows oder Linux, und es gibt keinen offiziellen Build für diese Plattformen.
mlx-serve Preise: Wirklich kostenlos?
Ja — mlx-serve hat keine kostenpflichtige Stufe. Das GitHub-Repository hat keine Preisseite, und die LICENSE-Datei gilt für die gesamte Anwendung. Der Lizenztext ist die Standard-MIT-Lizenz, Copyright David Dalcu — permissiv, ohne Copyleft-Verpflichtungen. GitHubs eigene Repository-Metadaten klassifizieren die Gesamtlizenz als benutzerdefinierten ("Other")-Eintrag statt als reines MIT-Badge, weil das Repository außerdem einige Drittkomponenten unter der Apache License 2.0 mitliefert, dokumentiert in einer separaten NOTICE-Datei.
- Kein Abonnement, keine kostenpflichtige Stufe, keine von mlx-serve selbst auferlegten Nutzungsgrenzen
- Kein Konto oder Anmeldung erforderlich, um den Server oder die MLX-Core-Begleit-App zu installieren oder zu nutzen
- Der Kerncode von mlx-serve ist MIT-lizenziert — permissiv, kostenlos für kommerzielle und nicht-kommerzielle Nutzung, mit im Lizenztext erhaltener Namensnennung
- Einige mitgelieferte Drittkomponenten (laut NOTICE-Datei des Repositorys) sind unter der Apache License 2.0 statt MIT lizenziert — lesen Sie die NOTICE-Datei direkt, falls die Compliance-Prüfung Ihrer Organisation von der genauen Lizenzmischung abhängt
mlx-serve vs. Ollama
mlx-serve und Ollama stellen beide lokale Modelle über eine HTTP-API auf einem Mac bereit, und werden häufig verglichen, weil beide hinter denselben Client-Tools stehen können. Die deutlichsten Unterschiede liegen im Plattformumfang und der Wahl der nativen Engine.
Aspekt | mlx-serve | Ollama |
|---|---|---|
| Plattformen | Nur macOS (Apple Silicon) | macOS, Windows, Linux |
| Native Engine | MLX (nativ) + eingebettetes llama.cpp für GGUF | Basiert auf llama.cpp |
| API-Kompatibilität | OpenAI + Anthropic + Ollama-API, gleicher Port | Eigene API, plus OpenAI-kompatibler Endpunkt |
| Mitgelieferte GUI | MLX-Core-Menüleisten-App (Chat, Agentenmodus, Medien-Gen.) | Minimale integrierte GUI; setzt auf Drittanbieter-Frontends |
| Laufzeitabhängigkeit | Einzelne ~7-MB-Binärdatei, kein Python | Einzelne Go-Binärdatei, kein Python |
| Medien-Generierung | Bild/Video/Musik/Sprache/3D über MLX Core | Nur Text- und Vision-Chat |
Die Ollama-API-Kompatibilität von mlx-serve bedeutet, dass für Ollama gebaute Tools laut Projektdokumentation oft direkt auf mlx-serve zeigen können. Wenn plattformübergreifende Unterstützung wichtig ist — Windows oder Linux, nicht nur macOS —, ist Ollama die Option mit breiterer Reichweite; prüfen Sie aktuelle Funktionsdetails direkt auf der jeweiligen Projektseite, bevor Sie sich entscheiden, da beide häufig Updates liefern.
Für wen eignet sich mlx-serve?
Ob mlx-serve passt, hängt davon ab, ob Sie Apple-Silicon-Hardware besitzen und einen einzigen Server wollen, der mehrere Client-API-Formate spricht, plus eine mitgelieferte GUI für Medien-Generierung.
mlx-serve vs. andere MLX-Inferenz-Tools
mlx-serve ist einer von mehreren Apple-Silicon-fokussierten Inferenzservern, die rund um Apples MLX-Framework entstanden sind. So schneidet es im Vergleich zu anderen Optionen in diesem Bereich ab — siehe das lokale KI-Software-Verzeichnis für den vollständigen Katalog und den eigenen mlx-serve-vs.-Ollama-Vergleich oben für den plattformübergreifend direktesten Vergleich.
- MLX LM — Apples eigene Python-Bibliothek und Kommandozeilen-Tools zum Ausführen und Feintunen von Sprachmodellen mit MLX; tiefer angesiedelt und Python-basiert, im Gegensatz zur eigenständigen Zig-Binärdatei von mlx-serve. Siehe die MLX-LM-Erklärung für einen tieferen Blick auf die zugrunde liegende Bibliothek, auf der das native Dispatch von mlx-serve aufbaut.
- omlx — eine weitere Apple-Silicon-fokussierte lokale Inferenzoption; siehe die eigene Review für den Vergleich von Funktionsumfang und API-Kompatibilität mit mlx-serve.
- rapid-mlx — ein performance-orientiertes MLX-basiertes Inferenz-Tool; siehe die eigene Review für einen Durchsatz- und Funktionsvergleich gegenüber mlx-serve.
- LoRAX — ein Serving-Framework für mehrere LoRA-Adapter; relevant, wenn Ihr Workflow viele feingetunte Adapter aus einem Basismodell statt eines einzelnen Modells pro Server bedienen muss, was nicht der Designschwerpunkt von mlx-serve ist.
- Ollama — ein plattformübergreifender lokaler Modellserver; siehe den eigenen Vergleichsabschnitt oben für die Unterschiede zu mlx-serve bei Plattformumfang und nativer Engine.
Häufige Fehler bei der Bewertung von mlx-serve
Die meiste Verwirrung um mlx-serve entsteht durch die Plattformbeschränkung, die Lizenzklassifizierung auf GitHub oder die Annahme, es handle sich wie bei den meisten anderen lokalen Inferenzservern um ein Python-Tool.
Häufig gestellte Fragen
Was ist mlx-serve?
mlx-serve (github.com/ddalcu/mlx-serve) ist ein kostenloser, quelloffener Inferenzserver in Zig, der KI-Modelle lokal auf Apple-Silicon-Macs ausführt und OpenAI-kompatible, Anthropic-kompatible und Ollama-kompatible APIs aus einer einzigen Binärdatei bereitstellt.
Ist mlx-serve kostenlos?
Ja. Das GitHub-Repository hat keine Preisseite, und die LICENSE-Datei ist die MIT-Lizenz, die für die gesamte Kernanwendung gilt, ohne kostenpflichtige Stufe.
Ist mlx-serve quelloffen? Welche Lizenz verwendet es?
Ja, mlx-serve ist quelloffen. Die Kern-LICENSE-Datei ist die Standard-MIT-Lizenz, Copyright David Dalcu. Das Repository liefert außerdem einige Drittkomponenten unter der Apache License 2.0 mit, gelistet in einer separaten NOTICE-Datei, weshalb GitHubs Repository-Metadaten die Lizenz als benutzerdefinierten ("Other")-Eintrag statt als reines MIT-Badge anzeigen. Prüfen Sie beide Dateien selbst für eine rechtliche Entscheidung.
Welche Plattformen unterstützt mlx-serve?
Nur macOS 26.2 oder neuer auf Apple-Silicon-Hardware (M-Serie), laut offiziellem GitHub-README. Es gibt keine Unterstützung für Windows, Linux oder Intel-Macs.
Benötigt mlx-serve Python?
Nein. mlx-serve ist in Zig geschrieben und wird als einzelne Binärdatei mit rund 7 MB Größe ausgeliefert, ganz ohne Python-Laufzeitabhängigkeit — im Gegensatz zu vielen anderen lokalen Inferenz-Tools.
Welche Modellformate unterstützt mlx-serve?
Modelle mit nativer MLX-Unterstützung (das README nennt Gemma, Qwen, Llama, Mistral und DeepSeek V4 Flash) laufen direkt über Apples MLX-Framework. Andere Modelle im GGUF-Format laufen stattdessen über eine eingebettete Kopie von llama.cpp, ohne separate Installation.
Was ist MLX Core?
MLX Core ist die gebündelte macOS-Menüleisten-Begleit-App für mlx-serve, installiert als separates Homebrew-Cask. Sie bietet Multi-Session-Chat, einen Agentenmodus mit MCP-Tool-Integration, einen Modell-Browser und Generierungs-Panels für Bilder, Video, Musik, Sprache und 3D-Modelle.
Kann mlx-serve Ollama für bestehende Tools ersetzen?
Oft ja — mlx-serve stellt neben OpenAI- und Anthropic-kompatiblen APIs auch eine Ollama-kompatible API auf demselben Port bereit, sodass für die Ollama-API gebaute Tools häufig mit nur einer Basis-URL-Änderung auf mlx-serve zeigen können. Prüfen Sie die Kompatibilität für Ihren konkreten Client, bevor Sie in einem Produktions-Workflow wechseln.
Wie installiere ich mlx-serve?
Über Homebrew: brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve gefolgt von brew install mlx-serve für den Server, und brew install --cask mlx-core für die optionale Menüleisten-Begleit-App. Prüfen Sie das offizielle GitHub-README auf aktuelle Anweisungen, bevor Sie installieren.
Wann wurde mlx-serve erstmals veröffentlicht?
Das GitHub-Repository von mlx-serve wurde im Februar 2026 angelegt. Stand dieser Review liefert das Projekt nahezu tägliche getaggte Releases — siehe die offizielle Releases-Seite für die vollständige Historie.