Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/mlxcel im Test: Rust-native MLX-Inferenz-Runtime
Overview & Reference

mlxcel im Test: Rust-native MLX-Inferenz-Runtime

·11 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

mlxcel ist eine kostenlose, quelloffene (Apache 2.0) Rust-native Inferenz-CLI und ein Server, der LLMs, Vision-Language-Modelle, Embeddings, Reranker und Audiomodelle auf Apple Silicon und NVIDIA CUDA ausführt, mit experimenteller AMD-ROCm-Unterstützung unter Linux. Entwickelt von Lablup – dem Unternehmen, das auch für die KI-Infrastrukturplattform Backend.AI bekannt ist – lädt es MLX-SafeTensors-Checkpoints direkt über native MLX-C++-Bindings, ohne Python-Interpreter im Anfragepfad, und wird über Homebrew oder einen Quellcode-Build installiert.

mlxcel (github.com/lablup/mlxcel) ist eine kostenlose, quelloffene, Rust-native Inferenz-CLI und ein Server für große Sprachmodelle, Vision-Language-Modelle, Embeddings, Reranking und Audio, entwickelt von Lablup, dem Unternehmen hinter Backend.AI. Es führt MLX-SafeTensors-Checkpoints direkt über native MLX-C++-Bindings aus – ohne Python-Interpreter im Anfragepfad und ohne separaten Checkpoint-Konvertierungsschritt. Dieser Test zeigt, was das Tool tatsächlich leistet, wie man es installiert und für wen es geeignet ist.

Wichtigste Erkenntnisse

  • mlxcel (github.com/lablup/mlxcel) ist eine kostenlose, quelloffene Inferenz-CLI und ein Server, installierbar über Homebrew oder einen Quellcode-Build
  • Entwickelt von Lablup, dem Unternehmen hinter der KI-Infrastrukturplattform Backend.AI
  • Apache-2.0-lizenziert, bestätigt über die LICENSE-Datei des GitHub-Repositorys
  • Vollständig native Ausführung: Rust plus MLX-C++-Bindings, kein Python-Interpreter im Anfragepfad, kein Checkpoint-Konvertierungsschritt für MLX-SafeTensors-Gewichte
  • Bietet OpenAI-, Anthropic- und Vertex-AI-kompatible Routen sowie eine dokumentierte, versionsgebundene llama-server-kompatible Routen- und Flag-Oberfläche
  • Primäres Ziel ist Apple Silicon (Metal); NVIDIA CUDA unter Linux ist ein sekundäres Ziel; AMD ROCm unter Linux ist experimentell und nur per Quellcode-Build verfügbar
  • Deckt Textgenerierung, Vision-Language-Eingaben, Embeddings, Reranking und Audio (Transkription und Sprachsynthese) in einer Runtime ab
  • Über 467 GitHub-Sterne zum Zeitpunkt dieses Tests

📍 In einem Satz

mlxcel ist eine kostenlose, quelloffene (Apache 2.0) Rust-native Inferenz-CLI und ein Server für LLMs, Vision-Language-Modelle, Embeddings, Reranker und Audio, entwickelt von Lablup für Apple Silicon und NVIDIA CUDA, mit experimenteller AMD-ROCm-Unterstützung.

💬 In einfachen Worten

mlxcel ist ein Kommandozeilen-Tool und Server, geschrieben in Rust statt Python, das KI-Modelle direkt aus den heruntergeladenen Dateien lädt und auf einem Mac oder einem CUDA-fähigen Linux-Rechner ausführt – keine separate Python-Umgebung nötig und kein Konvertierungsschritt, bevor ein Modell lädt. Es spricht dasselbe Anfrageformat wie die APIs von OpenAI und Anthropic, sodass vorhandener Client-Code direkt darauf zeigen kann.

📌Hinweis: Dieser Test basiert auf dem mlxcel-GitHub-Repository, dessen README und der verlinkten Dokumentation. Er übernimmt mlxcels eigene veröffentlichte Performance-Vergleiche mit mlx-lm und mlx-vlm nicht als unabhängig verifizierte Fakten – diese Zahlen stammen aus der eigenen Benchmark-Methodik des Projekts und sind als herstellerseitig gemeldet zu betrachten, nicht als von PromptQuorum getestet. Dieser Test ist der Deep-Dive-Begleiter zu mlxcels Eintrag im Local LLM Software Directory.

Was ist mlxcel?

mlxcel ist eine native Inferenz-Runtime – sowohl ein Kommandozeilen-Tool als auch ein Server – zum lokalen Ausführen von KI-Modellen ohne Python-Interpreter im Anfragepfad. Das eigene GitHub-README beschreibt es als Lösung, die „leistungsstarke LLM-, VLM-, Embedding-, Reranking- und Audio-Inferenz für Apple-Silicon- und NVIDIA-CUDA-Systeme" liefert, ausgeführt über „native MLX-C++-Bindings".

  • Produkttyp: eine Rust-native CLI (mlxcel) und ein Server (mlxcel-server), verteilt als kompilierte Binärdateien über Homebrew oder aus dem Quellcode gebaut – kein Python-Paket und keine grafische Desktop-App
  • Entwickler: Lablup Inc., ein Unternehmen, das auch für Backend.AI bekannt ist, eine quelloffene KI-Infrastruktur- und MLOps-Plattform
  • Repository: github.com/lablup/mlxcel, das ursprüngliche Projekt – unter anderen GitHub-Benutzernamen existieren mehrere Forks des Namens, die dieses Repository als übergeordnetes Projekt listen
  • Lizenz: Apache 2.0, bestätigt über die LICENSE-Datei des Repositorys
  • Begleitprodukt: Backend.AI Go, im eigenen README von mlxcel als optionale grafische Begleit-Oberfläche für lokalen Chat und Modellverwaltung beschrieben, die auf mlxcel-server aufsetzen kann

Projektgeschichte

Das README von mlxcel dokumentiert seine Versionsgeschichte über das CHANGELOG und beschreibt den aktuellen main-Branch als v0.7.0 plus unveröffentlichte Arbeiten. Das Projekt hat laut eigenem Changelog und README eine Reihe getaggter Releases durchlaufen und dabei Plattformziele und Serving-Funktionen hinzugefügt.

  1. 1
    Frühe Releases (bis v0.0.28) — Apple-Silicon-first-Inferenz
    Why it matters: Das README des Projekts verweist auf eine frühere Benchmark-Kampagne (im README-Text selbst auf Mai 2026 datiert), die mit mlxcel 0.0.28 durchgeführt wurde – ein Hinweis darauf, dass das Projekt bereits in frühen veröffentlichten Versionen funktionierendes Text-Decode- und Prefill-Benchmarking hatte.
  2. 2
    v0.6.0 — Spekulatives Decoding mit Exaktheitsrichtlinie
    Why it matters: Laut README führte dieses Release eine Richtlinie ein, die die Greedy-Exaktheit prüft, bevor schnellere spekulative Decoding-Pfade aktiviert werden, statt immer den schnellsten verfügbaren Kernel unabhängig von der Ausgabekorrektheit zu verwenden.
  3. 3
    v0.7.0 — Aktuelle Release-Basis
    Why it matters: Das README beschreibt dies als das neueste getaggte Release zum Zeitpunkt dieses Tests, mit Unterstützung für die DeepSeek-V4-Architektur, erweiterter llama-server-Routen-Kompatibilität und dtype-Korrekturen, die die Half-Precision-Performance bei mehreren Modellfamilien verbesserten.
  4. 4
    Unveröffentlichter main — Experimentelle AMD-ROCm-Unterstützung
    Why it matters: Zum Zeitpunkt dieses Tests ist AMD-GPU-Unterstützung über `--features rocm` im `main`-Branch vorhanden, aber laut dem README-Abschnitt „Current main highlights" noch nicht Teil eines getaggten Releases.

Was kann man mit mlxcel machen?

Der Funktionsumfang von mlxcel konzentriert sich auf das native Ausführen einer breiten Palette von Modelltypen mit produktionsorientierten Serving-Kontrollen. Hier ist, was jeder Teil tatsächlich leistet, laut dem eigenen README des Projekts.

  • Direktes Checkpoint-Laden — lädt MLX-SafeTensors-Checkpoints direkt von Hugging Face, einschließlich der Organisation mlx-community, wobei viele Standard-SafeTensors-Embedding-Checkpoints ebenfalls ohne Konvertierungsschritt laden
  • Multi-Format-API-Kompatibilität — bietet OpenAI (Chat Completions, Completions, Responses, Embeddings, Reranking, Audio), Anthropic Messages und Vertex-AI-kompatible Routen sowie eine dokumentierte, native, llama-server-kompatible Routen- und Flag-Oberfläche, die an ein bestimmtes Upstream-Release gebunden ist
  • Breite Architekturabdeckung — dichte Transformer, Sparse-Mixture-of-Experts-Modelle, hybride State-Space-Modelle, Vision-Language-/OCR-Modelle, Embeddings, Reranker, Speech-to-Text und Text-to-Speech, abfragbar über den Befehl mlxcel arch
  • Multi-Modell-Routing — der Router-Modus entdeckt Checkpoints aus einem Modellspeicher oder Verzeichnis, lädt sie bei Bedarf und begrenzt die residente Menge mit Least-Recently-Used-Verdrängung
  • Live-LoRA-Adapter — mehrere LoRA-Adapter können laut README ungefused bleiben für Umschalten pro Anfrage oder gefused werden für Null-Decode-Overhead
  • Spekulatives Decoding — gemessenes, auf Exaktheit geprüftes spekulatives Decoding für mehrere Modellfamilien (einschließlich Gemma-, Qwen- und GLM-4.7-Flash-MTP-Pfade), verfügbar über einen /v1/internal/mtp-policy-Endpunkt
  • Betriebskontrollen — API-Schlüssel- und CORS/TLS-Konfiguration, Idle-Modell-Sleep/Wake, GBNF-Grammatiken, erweiterte Sampling-Kontrollen und Prompt-/Cache-Beobachtbarkeit
  • Reproduzierbare Modelloperationen — YAML-definierte Gewichtsänderungen beim Laden (scale, add, prune, replace, interpolate) über ein --surgery-Flag, für reproduzierbare Checkpoint-Modifikation ohne manuelles Bearbeiten von Gewichten

Anwendungsbeispiele: Drei Wege, mlxcel zu nutzen

Dies sind konkrete Workflows, aufgebaut auf den oben dokumentierten Funktionen von mlxcel, mit Befehlen aus dem eigenen README des Projekts.

mlxcel Preise: Ist mlxcel wirklich kostenlos?

Ja — mlxcel hat keine kostenpflichtige Stufe. Es wird als kostenloses, Apache-2.0-lizenziertes Open-Source-Projekt ohne Konto, Lizenzschlüssel oder Nutzungsobergrenze vertrieben. Das GitHub-Repository hat keine Preisseite.

  • Keine Kosten für die Installation oder Ausführung von mlxcel selbst — sowohl die Homebrew-Formel als auch der Quellcode-Build sind kostenlos
  • Die Apache-2.0-Lizenz erlaubt kommerzielle Nutzung, Modifikation und Weiterverbreitung, vorbehaltlich der Standardbedingungen der Lizenz (Namensnennung und Erhalt des Lizenzhinweises)
  • Die einzigen echten Kosten sind die zum Betrieb erforderliche Hardware (ein Apple-Silicon-Mac oder eine CUDA-fähige GPU) und der Speicherplatz für separat heruntergeladene Modelle
  • Lablup, das Unternehmen hinter mlxcel, verkauft auch Backend.AI als kommerzielles KI-Infrastrukturprodukt, doch dieser Test fand keine Hinweise darauf, dass eine mlxcel-Funktion hinter einem Backend.AI-Kauf gesperrt ist — die optionale Begleit-App Backend.AI Go wird im README von mlxcel als separate, optionale GUI beschrieben, nicht als Voraussetzung

mlxcel vs. llama.cpp

mlxcel und llama.cpp sind beide native (Nicht-Python-)Inferenz-Runtimes, unterscheiden sich aber in Sprache, primärem Plattformfokus und Checkpoint-Format. llama.cpp ist ein C/C++-Projekt mit der breitesten Hardware-Unterstützung und quantisierten GGUF-Modellen; mlxcel ist ein Rust-Projekt mit Fokus auf MLX-SafeTensors-Checkpoints, Apple Silicon als primärem Ziel und dokumentierter llama-server-Routen-Kompatibilität für einfacheren Drop-in-Einsatz.

Sprache

mlxcel:
Rust
llama.cpp:
C/C++

Primäres Checkpoint-Format

mlxcel:
MLX SafeTensors
llama.cpp:
GGUF

Primäre Plattform

mlxcel:
Apple Silicon (Metal), CUDA sekundär
llama.cpp:
Breiteste Hardware-Unterstützung: CPU, CUDA, Metal, Vulkan u. a.

Maintainer

mlxcel:
Lablup (Backend.AI-Unternehmen)
llama.cpp:
Community-gepflegt, ursprünglich von Georgi Gerganov

API-Kompatibilität

mlxcel:
OpenAI, Anthropic, Vertex, plus llama-server-kompatible Routen
llama.cpp:
Der eigene llama-server ist die Referenzimplementierung, zu der mlxcel Kompatibilität anstrebt

Dies ist ein sachlicher Funktionsvergleich auf Basis der Dokumentation der jeweiligen Projekte, kein von PromptQuorum durchgeführter Benchmark eines der beiden Tools. mlxcel zielt laut eigenem dokumentiertem b10621-Kompatibilitätsmanifest ausdrücklich auf Kompatibilität mit der llama-server-Routen-Oberfläche von llama.cpp ab, statt sich als unabhängige Alternative zu positionieren.

Für wen eignet sich mlxcel?

mlxcel eignet sich für Entwickler, die eine native, produktionsorientierte Inferenz-Runtime ohne Python-Abhängigkeit im Serving-Pfad wollen.

Häufige Fehler bei der Bewertung von mlxcel

Die meiste Verwirrung über mlxcel entsteht durch die Annahme, dass die Plattform-Unterstützung oder das Checkpoint-Format breiter sind als dokumentiert.

Konkurrenten und Alternativen

mlxcel befindet sich im selben Segment für Apple-Silicon- und native-Runtime-Inferenz-Server wie vllm-mlx, oMLX und Rapid-MLX — unabhängige Projekte, die lokale Modelle mit einer OpenAI-kompatiblen oder ähnlichen API-Oberfläche ausführen, die sich hauptsächlich in Sprache (Rust vs. Python), Plattformbreite und Funktionsschwerpunkt unterscheiden.

Tool
Bekannt für
Link
vllm-mlxvLLM-artiges Continuous Batching für Apple Silicon, Python-basiertvllm-mlx Review
oMLXApple-Silicon-Inferenz-Server mit SSD-gestütztem Prompt-CachingoMLX Review
Rapid-MLXNative MLX-Inferenz-Server mit Fokus auf Serving-GeschwindigkeitRapid-MLX Review
LoRAXTausende LoRA-Adapter aus einem Basismodell auf einer GPU bedienenLoRAX Review

Diese Liste spiegelt häufig im Bereich Apple-Silicon- und native-Runtime-Inferenz-Engines verglichene Tools wider, kein unabhängiges PromptQuorum-Ranking — vor der Auswahl den aktuellen Funktionsumfang jedes Tools prüfen.

Häufig gestellte Fragen

Was ist mlxcel?

mlxcel (github.com/lablup/mlxcel) ist eine kostenlose, quelloffene (Apache 2.0) Rust-native Inferenz-CLI und ein Server für LLMs, Vision-Language-Modelle, Embeddings, Reranker und Audio, entwickelt von Lablup.

Wer entwickelt mlxcel?

Lablup Inc., das Unternehmen, das auch für die KI-Infrastruktur- und MLOps-Plattform Backend.AI bekannt ist.

Ist mlxcel kostenlos?

Ja. Es wird kostenlos über Homebrew oder einen Quellcode-Build installiert, ist Apache-2.0-lizenziert und hat keine kostenpflichtige Stufe, kein Konto und keine Nutzungsobergrenze.

Wie installiere ich mlxcel?

brew tap lablup/tap && brew install mlxcel unter macOS oder Linux ausführen, oder aus dem Quellcode mit Cargo bauen und dabei das passende Feature-Flag (metal, cuda oder das experimentelle rocm) verwenden, laut dem README des Projekts.

Welche Hardware unterstützt mlxcel?

Apple Silicon (Metal) ist das primäre Ziel. NVIDIA CUDA unter Linux ist ein sekundäres, unterstütztes Ziel. AMD ROCm unter Linux ist experimentell und nur per Quellcode-Build verfügbar. Ein reiner CPU-only-Linux-Build funktioniert, ist aber kein validiertes Release-Ziel.

Benötigt mlxcel Python?

Nein. mlxcel ist in Rust geschrieben und führt MLX-Checkpoints über native MLX-C++-Bindings aus, ohne Python-Interpreter im Anfragepfad.

Welches Checkpoint-Format verwendet mlxcel?

MLX-SafeTensors-Checkpoints, einschließlich jener, die unter der Hugging-Face-Organisation mlx-community veröffentlicht werden — nicht das von llama.cpp verwendete GGUF-Format.

Ist mlxcel mit der API von llama.cpp kompatibel?

Ja, teilweise und bewusst so gestaltet: mlxcel dokumentiert ein eingefrorenes, versionsgebundenes Kompatibilitätsmanifest für llama-server-Routen und -Flags neben den eigenen OpenAI-, Anthropic- und Vertex-kompatiblen Endpunkten.

Unterstützt mlxcel Audio- und Vision-Modelle?

Ja. Es verarbeitet Vision-Language-Eingaben, Speech-to-Text-Transkription und Text-to-Speech-Synthese (über Modelle der Kokoro-Familie) neben Textgenerierung, Embeddings und Reranking.

Hat PromptQuorum die Benchmark-Aussagen von mlxcel unabhängig getestet?

Nein. Dieser Test basiert auf dem eigenen GitHub-Repository und README von mlxcel, nicht auf praktischem Benchmarking durch PromptQuorum. Die Performance-Vergleiche im README des Projekts sind selbst gemessen.

Quellen

← Zurück zu Lokale LLMs Pro