Wichtigste Erkenntnisse
- vllm-mlx (github.com/waybarrios/vllm-mlx) ist ein kostenloser, quelloffener Inferenzserver, installiert über
pip install vllm-mlx - Entwickelt vom unabhängigen Entwickler Way Barrios; nicht das offizielle vLLM-Projekt (github.com/vllm-project/vllm) und nicht mit dem vLLM-Team verbunden
- Apache-2.0-lizenziert, bestätigt über die LICENSE-Datei des GitHub-Repositorys
- Stellt OpenAI-kompatible (
/v1/chat/completions,/v1/embeddings,/v1/rerank,/v1/responses) und Anthropic-kompatible (/v1/messages) Endpunkte aus einem Serverprozess bereit - Serving-Funktionen, adaptiert von vLLM: Continuous Batching, Paged-KV-Cache, Prefix-Caching und optionaler SSD-basierter Cache für Long-Context-Workloads
- Verarbeitet Text-, Vision- (Bild/Video), Audio- (TTS/STT) und Embedding-/Reranking-Modelle, vollständig über natives MLX auf Apple Silicon
- Setzt einen Apple-Silicon-Mac (M1 bis M5) voraus — es gibt keine Unterstützung für Windows, Linux oder Intel-Macs
- Über 1.580 GitHub-Stars zum Zeitpunkt dieses Tests
📍 In einem Satz
vllm-mlx ist ein kostenloser, quelloffener (Apache 2.0), Python-basierter Inferenzserver, der vLLM-artiges Continuous Batching und Paged-KV-Caching über natives MLX auf Apple-Silicon-Macs bringt und sowohl OpenAI- als auch Anthropic-kompatible API-Endpunkte bereitstellt.
💬 In einfachen Worten
Mit vllm-mlx lassen sich KI-Modelle auf dem eigenen Mac ausführen und genauso ansprechen wie die Cloud-APIs von OpenAI oder Anthropic — bestehender Code zeigt einfach auf localhost statt auf die Cloud. Das Tool ist darauf ausgelegt, mehrere Anfragen gleichzeitig effizient zu verarbeiten — daher der „vLLM-Style"-Teil im Namen —, ist aber ein eigenständiges, inoffizielles Projekt und nicht vLLM selbst auf dem Mac.
📌Hinweis: Dieser Test basiert auf dem GitHub-Repository von vllm-mlx, dessen README, der Dokumentations-Website und dem PyPI-Paketeintrag. Die vom Projekt selbst veröffentlichten Durchsatz-Benchmarks werden nicht als unabhängig verifizierte Fakten wiedergegeben — diese Werte stammen aus dem README des Projekts und sind als herstellerseitig gemeldet zu behandeln, nicht als von PromptQuorum getestet. Dieser Test ist der ausführliche Begleitartikel zum vllm-mlx-Eintrag im Local LLM Software Directory.
Was ist vllm-mlx?
vllm-mlx ist ein Kommandozeilen-Inferenzserver für Apple-Silicon-Macs, der lokal laufende KI-Modelle über dieselben API-Formate bereitstellt, die OpenAI und die Cloud-Dienste von Anthropic verwenden. Das eigene GitHub-README beschreibt es als „Continuous Batching + OpenAI + Anthropic APIs in einem Server" mit „nativer Apple-Silicon-Inferenz". Es ist keine grafische Desktop-Anwendung — es handelt sich um ein Python-Paket, das im Terminal gestartet wird und anschließend auf einem lokalen Port auf API-Anfragen wartet.
- Produkttyp: ein Python-basierter CLI-Inferenzserver, installiert als pip-/uv-Paket, keine herunterladbare GUI-Anwendung
- Entwickler: der unabhängige Entwickler Way Barrios (GitHub-Handle
waybarrios); dieser Test fand keine Hinweise auf ein Unternehmen, eine Finanzierungsrunde oder eine kommerzielle Organisation hinter dem Projekt - Repository: github.com/waybarrios/vllm-mlx, das früheste und meistgesternte mehrerer gleichnamiger Repositorys auf GitHub — andere Repositorys mit demselben Namen (z. B. unter anderen Nutzernamen) bezeichnen dieses als das Projekt, das sie spiegeln
- Lizenz: Apache 2.0, bestätigt über die LICENSE-Datei des Repositorys
- Namensgebung: „vllm-mlx" signalisiert, dass das Projekt dem Serving-API-Design und der Terminologie von vLLM folgt (Continuous Batching, Paged-KV-Cache), dabei jedoch auf MLX statt auf vLLMs eigener CUDA-/ROCm-basierter Engine läuft — es enthält nicht die ursprüngliche Codebasis von vLLM
Projektgeschichte
vllm-mlx ist ein vergleichsweise junges Projekt. Die PyPI-Paketseite und das GitHub-Repository zeigen aktive, laufende Entwicklung statt einer langen, mehrjährigen Versionsgeschichte, und das README dokumentiert bereits einen breiten Funktionsumfang — OpenAI- und Anthropic-API-Kompatibilität, Continuous Batching, Multimodal-Unterstützung und MCP-Tool-Calling — als aktuellen Stand statt als stufenweisen Rollout.
- Vertrieben auf PyPI als Paket
vllm-mlx, mit veröffentlichten Versions-Tags, sichtbar überpip index versions vllm-mlxoder die PyPI-Projektseite - Aktiv gepflegt: Das GitHub-Repository zeigt laufende Commits und eine Dokumentations-Website unter vllm-mlx.is-a.dev
- Das README ist vom Projekt selbst in mehrere Sprachen übersetzt (Englisch, Spanisch, Französisch, Chinesisch) — ungewöhnlich für ein Projekt dieser Größe und ein Hinweis auf eine international verteilte Nutzerbasis
- Der Funktionsumfang umfasst zum Zeitpunkt dieses Tests bereits Unterstützung für Reasoning-Modelle (Qwen3, DeepSeek-R1-artige Reasoning-Extraktion), spekulative Dekodierung und Mixture-of-Experts-Optimierungen
Was kann man mit vllm-mlx tun?
Der Funktionsumfang von vllm-mlx konzentriert sich darauf, mehrere gleichzeitige Anfragen effizient auf einem einzelnen Mac zu bedienen, und geht dabei über reine Textgenerierung hinaus. Hier ist, was jeder Teil laut eigenem README und Dokumentations-Website des Projekts tatsächlich leistet.
- Duale API-Kompatibilität — stellt sowohl OpenAI-artige (
/v1/chat/completions,/v1/completions,/v1/embeddings,/v1/rerank,/v1/responses) als auch Anthropic-artige (/v1/messages, mit Streaming, Tool-Nutzung und System-Prompts) Endpunkte aus einem laufenden Server bereit - Continuous Batching — verarbeitet mehrere gleichzeitige Anfragen zusammen statt nacheinander, dieselbe Technik, die vLLM für GPU-Serving populär gemacht hat, hier adaptiert für MLX/Metal
- Paged- und Prefix-KV-Caching — ein speichereffizienter, Trie-basierter Cache, der wiederholte Prompt-Präfixe über Anfragen hinweg teilt, mit optionalem
--ssd-cache-dir-Flag, um den Cache für Long-Context-Agenten-Workloads auf die Festplatte auszulagern - Multimodale Unterstützung — Text-, Bild-, Video- und Audio-Eingaben aus einem Server; dokumentierte kompatible Vision-Modellfamilien umfassen Gemma, Qwen3-VL, Pixtral und Llama-Vision-Varianten
- Integriertes Audio — Text-to-Speech (laut README mehrere Stimmen und Sprachen) und Speech-to-Text über Whisper-Modellfamilien, ausgeführt im selben Serverprozess
- MCP-Tool-Calling — Unterstützung für das Model Context Protocol mit Parsern für mehrere Modellfamilien (das README listet unter anderem OpenAI-, Anthropic-, Gemini-, Qwen-, DeepSeek- und Gemma-artige Tool-Call-Formate), plus explizite Claude-Code-Kompatibilität über den Anthropic-kompatiblen Endpunkt
- Reasoning- und MoE-Funktionen — Reasoning-Token-Extraktion für Modelle wie Qwen3 und DeepSeek-R1, plus Mixture-of-Experts-Routing-Optionen und spekulative Dekodierung für unterstützte Modellfamilien
- Observability und Benchmarking — ein optionaler Prometheus-
/metrics-Endpunkt und ein integriertervllm-mlx bench-serve-Befehl zum Ausführen und Protokollieren von Durchsatzmessungen
Anwendungsbeispiele: Drei Wege, vllm-mlx zu nutzen
Dies sind konkrete Workflows, aufgebaut auf den oben dokumentierten Funktionen von vllm-mlx, mit Befehlen aus dem eigenen README des Projekts.
vllm-mlx installieren
vllm-mlx lässt sich kostenlos über pip oder uv installieren, der Quellcode liegt auf GitHub. Als CLI-Tool für Entwickler gibt es keinen herunterladbaren Installer pro Betriebssystem — die Installation läuft immer über Pythons Paket-Tooling.
Quelle | Link |
|---|---|
| Offizielle Dokumentation | vllm-mlx.is-a.dev |
| GitHub-Repository (Quellcode, Apache 2.0) | github.com/waybarrios/vllm-mlx |
| PyPI-Paket | pypi.org/project/vllm-mlx |
| Schnellinstallation (uv) | uv tool install vllm-mlx |
| Schnellinstallation (pip) | pip install vllm-mlx |
vllm-mlx setzt einen Apple-Silicon-Mac (M1, M2, M3, M4 oder M5) mit macOS und dem MLX-Framework voraus — es läuft nicht auf Intel-Macs, Windows oder Linux. Audio-Funktionen erfordern laut README zusätzlich den Schritt `pip install vllm-mlx[audio] sowie brew install espeak-ng` für nicht-englisches Text-to-Speech.
vllm-mlx Preise: Ist vllm-mlx wirklich kostenlos?
Ja — vllm-mlx hat keine kostenpflichtige Stufe. Es wird als kostenloses, Apache-2.0-lizenziertes PyPI-Paket ohne Konto, Lizenzschlüssel oder Nutzungsobergrenze vertrieben. Das GitHub-Repository hat keine Preisseite, und weder README noch Dokumentation beschreiben eine kommerzielle oder Enterprise-Edition.
- Keine Kosten für Installation oder Betrieb von vllm-mlx selbst —
pip install vllm-mlxist die gesamte Transaktion - Die Apache-2.0-Lizenz erlaubt kommerzielle Nutzung, Modifikation und Weiterverbreitung, vorbehaltlich der Standardbedingungen der Lizenz (Namensnennung und Erhalt des Lizenzhinweises)
- Die einzigen tatsächlichen Kosten sind die für den Betrieb erforderliche Apple-Silicon-Mac-Hardware sowie der Speicherplatz für separat von Hugging Face oder der Organisation
mlx-communityheruntergeladene Modelle - Für diesen Test wurde keine vom Entwickler gehostete Cloud-Version, gehostete API oder verwaltete Angebotsform gefunden — vllm-mlx läuft ausschließlich auf selbst kontrollierter Hardware
vllm-mlx vs. mlx-lm
vllm-mlx und mlx-lm führen beide Modelle über Apples MLX-Framework aus, lösen aber unterschiedliche Probleme. mlx-lm ist Apples eigene, tiefer liegende Python-Bibliothek und CLI zum Ausführen und Fine-Tunen von MLX-Modellen jeweils für eine einzelne Anfrage; vllm-mlx ist ein höherliegender Server, aufgebaut auf Bibliotheken wie mlx-lm, mlx-vlm und mlx-audio (laut eigenem Architekturdiagramm), der die von vLLM bekannten Serving-Funktionen für gleichzeitige Anfragen ergänzt.
Maintainer
- vllm-mlx:
- Unabhängiger Entwickler (Way Barrios)
- mlx-lm:
- Apples MLX-Team
Primärer Anwendungsfall
- vllm-mlx:
- API-Server für gleichzeitige Anfragen
- mlx-lm:
- Bibliothek für Einzelanfrage-Generierung und Fine-Tuning
Gleichzeitiges Batching
- vllm-mlx:
- Continuous Batching, Paged-KV-Cache
- mlx-lm:
- Kein Kernfokus; typischerweise eine Anfrage nach der anderen
API-Oberfläche
- vllm-mlx:
- OpenAI- und Anthropic-kompatible Endpunkte
- mlx-lm:
- Python-API und CLI, kein integrierter Server im Anthropic-Format
Beziehung
- vllm-mlx:
- Baut intern auf mlx-lm, mlx-vlm, mlx-audio auf
- mlx-lm:
- Eine grundlegende Abhängigkeit, auf der andere MLX-Tools aufbauen
Dies ist ein sachlicher Funktionsvergleich basierend auf der jeweils eigenen Dokumentation der Projekte, kein von PromptQuorum durchgeführter Benchmark. Die beiden sind keine strikten Konkurrenten — vllm-mlx baut auf mlx-lm auf, statt es zu ersetzen.
Für wen eignet sich vllm-mlx?
vllm-mlx eignet sich für Entwickler auf Apple Silicon, die produktionsnahes, gleichzeitiges Serving wollen statt einer Single-User-Chat-App.
Häufige Fehler bei der Bewertung von vllm-mlx
Die meiste Verwirrung rund um vllm-mlx entsteht durch den Namen, der Annahmen nahelegt, die das Projekt selbst nicht trifft.
Wettbewerber und Alternativen
vllm-mlx bewegt sich im selben Apple-Silicon-Inferenzserver-Segment wie oMLX, Rapid-MLX und mlxcel — alles unabhängige Projekte, die lokale Modelle über MLX mit einer OpenAI-kompatiblen oder ähnlichen API-Oberfläche ausführen und sich vor allem in Sprache (Python vs. Rust), Funktionsschwerpunkt und Caching-Strategie unterscheiden.
Tool | Bekannt für | Link |
|---|---|---|
| oMLX | Apple-Silicon-Inferenzserver mit SSD-gestütztem Prompt-Caching | oMLX Review |
| Rapid-MLX | Nativer MLX-Inferenzserver mit Fokus auf Serving-Geschwindigkeit | Rapid-MLX Review |
| mlxcel | Rust-natives MLX-Runtime für LLMs, VLMs, Embeddings und Audio | mlxcel Review |
| LoRAX | Serving Tausender LoRA-Adapter aus einem Basismodell auf einer GPU | LoRAX Review |
Diese Liste zeigt Tools, die im Apple-Silicon- und Adapter-Serving-Inferenzengine-Bereich häufig verglichen werden, kein unabhängiges Ranking von PromptQuorum — prüfen Sie den aktuellen Funktionsumfang jedes Tools, bevor Sie sich entscheiden.
Häufig gestellte Fragen
Was ist vllm-mlx?
vllm-mlx (github.com/waybarrios/vllm-mlx) ist ein kostenloser, quelloffener (Apache 2.0) Inferenzserver, der KI-Modelle über natives MLX auf Apple-Silicon-Macs ausführt und sowohl OpenAI- als auch Anthropic-kompatible API-Endpunkte bereitstellt.
Ist vllm-mlx dasselbe wie vLLM?
Nein. vllm-mlx ist ein unabhängiges, inoffizielles Projekt, das die Serving-Konzepte von vLLM (Continuous Batching, Paged-KV-Cache) für Apples MLX-Framework adaptiert. Es ist nicht mit dem offiziellen vLLM-Projekt oder -Team verbunden und enthält nicht die ursprüngliche Codebasis von vLLM.
Ist vllm-mlx kostenlos?
Ja. Es lässt sich kostenlos über pip install vllm-mlx installieren, ist Apache-2.0-lizenziert und hat keine kostenpflichtige Stufe, kein Konto und keine Nutzungsobergrenze.
Wie installiere ich vllm-mlx?
Führen Sie laut eigenem README des Projekts pip install vllm-mlx oder uv tool install vllm-mlx aus. Ein Apple-Silicon-Mac ist erforderlich; es gibt keine Unterstützung für Windows, Linux oder Intel-Macs.
Funktioniert vllm-mlx mit Claude Code?
Ja. Das Projekt dokumentiert explizite Claude-Code-Unterstützung, indem ANTHROPIC_BASE_URL auf den lokal servierten vllm-mlx-Endpunkt gesetzt wird, da es einen Anthropic-kompatiblen /v1/messages-Endpunkt bereitstellt.
Welche Hardware benötigt vllm-mlx?
Einen Apple-Silicon-Mac (M1, M2, M3, M4 oder M5). Es nutzt Metal-Kernels über MLX und hat keinen reinen CPU-Fallback oder Unterstützung für Nicht-Apple-GPUs.
Wer hat vllm-mlx entwickelt?
Der unabhängige Entwickler Way Barrios, GitHub-Handle waybarrios. Dieser Test fand keine Hinweise auf ein Unternehmen oder eine Finanzierungsrunde hinter dem Projekt.
Unterstützt vllm-mlx Vision- und Audio-Modelle oder nur Text?
Es unterstützt laut README Text-, Vision- (Bild/Video) und Audio-Modelle (Text-to-Speech und Speech-to-Text) sowie Embeddings und Reranking, alles serviert aus demselben Prozess.
Was ist Continuous Batching?
Eine von vLLM populär gemachte Serving-Technik, die mehrere gleichzeitige Anfragen zusammen statt nacheinander verarbeitet und so den Durchsatz verbessert, wenn ein Server mehrere Anfragen gleichzeitig bedient. vllm-mlx adaptiert dieses Konzept für MLX auf Apple Silicon.
Hat PromptQuorum die Benchmark-Angaben von vllm-mlx unabhängig getestet?
Nein. Dieser Test basiert auf dem eigenen GitHub-Repository, README und der Dokumentations-Website von vllm-mlx, nicht auf praktischem Benchmarking durch PromptQuorum. Durchsatzangaben im README des Projekts sind selbst gemeldet.