Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/MLX-LM erklärt 2026: Apples eigenes LLM-Toolkit für Apple Silicon
Overview & Reference

MLX-LM erklärt 2026: Apples eigenes LLM-Toolkit für Apple Silicon

·8 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

MLX-LM ist ein kostenloses, MIT-lizenziertes Python-Paket von Apple Machine Learning Research zum Generieren von Text und Feintunen großer Sprachmodelle auf Apple Silicon, aufgebaut auf MLX, Apples eigenem Array-Framework. MLX ist um Unified Memory herum konzipiert — Modellgewichte, der KV-Cache und Aktivierungen liegen alle in einem gemeinsamen physischen Speicherpool, der von CPU und GPU geteilt wird, wodurch der Kopieraufwand entfällt, den getrennte CPU-/GPU-Speicherpools auf anderen Architekturen erfordern. MLX-LM unterstützt die Integration mit dem Hugging Face Hub, Quantisierung sowie sowohl LoRA- als auch vollständiges Fine-Tuning, ist aber ausschließlich für Apple Silicon gedacht — es läuft nicht unter Windows, Linux oder auf Intel-Macs.

MLX-LM ist das eigene Python-Paket von Apple Machine Learning Research zum Ausführen und Feintunen von Sprachmodellen auf Apple Silicon, aufgebaut auf MLX, Apples Array-Framework, das gezielt um die Unified-Memory-Architektur der M-Serie-Chips herum entwickelt wurde.

MLX-LM erklärt 2026: Apples eigenes LLM-Toolkit für Apple Silicon

Wichtigste Erkenntnisse

  • MIT-Lizenz, entwickelt von Apple Machine Learning Research
  • MLX (das zugrunde liegende Framework) hat rund 27.300 GitHub-Stars überschritten; mlx-lm speziell liegt bei rund 6.900+
  • Erstveröffentlichung am 5. Dezember 2023; im Januar 2026 veröffentlichte Apple Forschung zu Neural Accelerators in jedem M5-GPU-Kern, speziell mit MLX benchmarkt
  • Nur Apple Silicon (M-Serie) — keine Unterstützung für Windows, Linux, Intel-Macs oder Nicht-Apple-GPUs
  • Basiert auf Unified Memory: Gewichte, KV-Cache und Aktivierungen teilen sich einen Speicherpool zwischen CPU und GPU, ohne Kopieraufwand
  • Unterstützt Modellzugriff über den Hugging Face Hub, Quantisierung mit Hub-Upload sowie sowohl LoRA- als auch vollständiges Fine-Tuning, auch für quantisierte Modelle

📍 In einem Satz

MLX-LM ist ein kostenloses, MIT-lizenziertes Python-Paket von Apple Machine Learning Research zum Ausführen und Feintunen von LLMs auf Apple Silicon, aufgebaut auf MLX's Unified-Memory-Array-Framework, aber ausschließlich auf Mac-Hardware mit M-Serie-Chip beschränkt.

💬 In einfachen Worten

Bei einem Windows- oder Linux-PC verfügen CPU und GPU jeweils über getrennten Speicher, sodass Daten zwischen ihnen kopiert werden müssen; MLX baut darauf auf, dass sich CPU und GPU auf einem Mac mit Apple Silicon bereits denselben physischen Speicher teilen, wodurch MLX-LM diesen Kopierschritt vollständig überspringen kann.

📌Hinweis: MLX-LM ist Apples eigenes Tool und bewusst ausschließlich für Apple Silicon konzipiert — es ist keine plattformübergreifende Alternative zu llama.cpp, sondern eine Mac-spezifische.

Was ist MLX-LM?

MLX-LM ist ein kostenloses, quelloffenes Python-Paket von Apple Machine Learning Research zum Generieren von Text und Feintunen großer Sprachmodelle speziell auf Apple Silicon, aufgebaut auf MLX, Apples eigenem Array-Framework. MLX selbst erschien erstmals am 5. Dezember 2023, mit mlx-lm als Begleitpaket, das sich gezielt auf Sprachmodell-Workflows konzentriert.

Das Projekt wird unter github.com/ml-explore/mlx-lm unter der MIT-Lizenz gehostet. MLX, das übergeordnete Framework, hat rund 27.300 GitHub-Stars überschritten, während mlx-lm speziell bei rund 6.900+ liegt.

  • Integriert sich mit dem Hugging Face Hub für Modellzugriff, einschließlich Unterstützung zur Quantisierung von Modellen und zum Hochladen der Ergebnisse zurück in den Hub
  • Unterstützt sowohl Low-Rank-Fine-Tuning (LoRA) als auch vollständiges Fine-Tuning, einschließlich des Fine-Tunings bereits quantisierter Modelle
  • Enthält Prompt Caching und einen rotierenden Key-Value-Cache für Effizienz während der Generierung
  • Unterstützt verteilte Inferenz und Fine-Tuning über mehrere Maschinen hinweg via mx.distributed
  • Bietet Streaming-Ausgabe bei der Generierung sowie den Befehl mlx_lm.server zum Bereitstellen von Modellen

Was ist Unified Memory, und warum ist MLX darauf angewiesen?

Unified Memory bedeutet, dass sich CPU und GPU auf Apple Silicon einen einzigen physischen Speicherpool teilen, statt jeweils über getrennten, dedizierten Speicher zu verfügen, zwischen dem Daten kopiert werden müssten. MLX ist gezielt um diese Architektur herum konzipiert, die sich grundlegend vom getrennten Setup aus CPU-RAM und separatem GPU-VRAM unterscheidet, das man auf Windows- und Linux-Systemen mit dedizierter NVIDIA- oder AMD-GPU findet.

  • Modellgewichte, der KV-Cache und Aktivierungen liegen alle im selben Speicherpool, auf den CPU und GPU ohne Kopierschritt zugreifen können
  • Operationen können je nach Bedarf über CPU und GPU verteilt werden, ohne den Datenübertragungs-Overhead, den ein System mit dedizierter GPU erfordert
  • Dies ist eine Hardware-Eigenschaft von Apple Silicon (M-Serie-Chips), die MLX gezielt ausnutzt — kein Software-Trick, der auf Nicht-Apple-Hardware identisch nachgebildet werden könnte
  • Im Januar 2026 veröffentlichte Apple Forschung, die gezielt die dedizierten Neural Accelerators in jedem GPU-Kern des M5-Chips beim Betrieb mit MLX benchmarkte

Wie installiert und nutzt man MLX-LM?

MLX-LM wird über pip oder conda installiert und bietet sowohl eine Kommandozeilen-Schnittstelle als auch eine Python-API für Generierung, Fine-Tuning und Bereitstellung. Es erfordert macOS auf Apple Silicon; manche Funktionen setzen macOS 15.0 oder neuer voraus.

  1. 1
    Installation über pip: pip install mlx-lm, oder über conda: conda install -c conda-forge mlx-lm.
  2. 2
    Text direkt aus einem Modell des Hugging Face Hub generieren, z. B. mlx_lm.generate --model <hf-model-id> --prompt "...", wodurch das Modell heruntergeladen und ausgeführt wird.
  3. 3
    Zum Fine-Tuning die LoRA- oder Vollständig-Fine-Tuning-Befehle nutzen, die im GitHub-README des Projekts dokumentiert sind und sowohl Vollpräzisions- als auch bereits quantisierte Basismodelle unterstützen.
  4. 4
    Zum Quantisieren eines Modells und optionalen Hochladen zurück in den Hugging Face Hub die Konvertierungs- und Quantisierungswerkzeuge des Projekts nutzen.
  5. 5
    Um ein Modell über eine API bereitzustellen, mlx_lm.server ausführen, wodurch ein lokaler Server für den programmatischen Zugriff startet.
  6. 6
    Für verteilte Inferenz oder Fine-Tuning über mehrere Maschinen mx.distributed gemäß den fortgeschrittenen Nutzungsanleitungen des Projekts konfigurieren.

Läuft MLX-LM auf Intel-Macs?

Nein. MLX-LM benötigt Apple Silicon (einen M-Serie-Chip) — Intel-basierte Macs werden nicht unterstützt.

Benötigt MLX-LM eine Internetverbindung?

Nur zum anfänglichen Herunterladen von Modellen, typischerweise vom Hugging Face Hub. Sobald ein Modell heruntergeladen ist, laufen Generierung und Inferenz vollständig lokal.

Welche Hardware benötigt MLX-LM?

MLX-LM benötigt einen Mac mit Apple Silicon — es gibt keine Unterstützung für Intel-Macs, Windows, Linux oder Nicht-Apple-GPUs jeglicher Art. Das ist der zentrale Kompromiss gegenüber plattformübergreifenden Engines wie llama.cpp.

  • Apple Silicon (M-Serie-Chip) erforderlich — von M1 bis zur aktuellen Generation werden unterstützt, wobei neuere Chips von laufenden MLX-Optimierungen profitieren
  • Keine Unterstützung für Intel-Macs, obwohl auch diese macOS ausführen
  • Keinerlei Unterstützung für Windows oder Linux
  • Keine Unterstützung für Nicht-Apple-GPUs — MLX läuft nicht auf NVIDIA- oder AMD-Hardware
  • Manche Funktionen setzen speziell macOS 15.0 oder neuer voraus, einschließlich einer dokumentierten Wired-Memory-Optimierung

Wer sollte MLX-LM nutzen?

Nutzen Sie MLX-LM, wenn die Zielmaschine bestätigt Apple Silicon ist und es darauf ankommt, das Beste aus dem Unified Memory dieser spezifischen Hardware herauszuholen; nutzen Sie eine plattformübergreifende Engine, wenn die Hardware flexibel oder nicht-Mac sein muss.

Wie schneidet MLX-LM im Vergleich zu llama.cpp und anderen Engines ab?

Der nächstliegende Vergleich für MLX-LM ist llama.cpps eigenes Metal-Backend, da beide auf Apple Silicon laufen — der Unterschied ist, dass MLX-LM Apples eigenes Framework ist, exklusiv für Mac, während llama.cpp zusätzlich NVIDIA-, AMD- und Intel-Hardware abdeckt.

Tool
Lizenz
Am besten für
MLX-LMMITApple-Silicon-spezifisch, Unified Memory
llama.cppMITBreiteste Hardware-Unterstützung, direkte Kontrolle
OllamaMITEinfachstes plattformübergreifendes lokales Setup
vLLMApache 2.0Hochdurchsatzstarkes Multi-User-Serving
SGLangApache 2.0Prefix-Caching für Chat/strukturierte Ausgabe

Häufige Fehler bei der Bewertung von MLX-LM

Die meiste Verwirrung entsteht, wenn erwartet wird, dass MLX-LM außerhalb von Apple Silicon funktioniert, oder wenn missverstanden wird, was Unified Memory tatsächlich verändert.

Häufig gestellte Fragen

Was ist MLX-LM?

MLX-LM ist ein kostenloses, MIT-lizenziertes Python-Paket von Apple Machine Learning Research zum Generieren von Text und Feintunen großer Sprachmodelle auf Apple Silicon, aufgebaut auf Apples MLX-Array-Framework.

Läuft MLX-LM unter Windows oder Linux?

Nein. MLX-LM benötigt Apple Silicon und läuft nur unter macOS auf Mac-Hardware der M-Serie.

Ist MLX-LM kommerziell kostenlos nutzbar?

Ja. MLX-LM ist MIT-lizenziert, kostenlos für private und kommerzielle Nutzung.

Was ist Unified Memory bei MLX?

Unified Memory bedeutet, dass sich CPU und GPU auf Apple Silicon einen physischen Speicherpool teilen, sodass Modellgewichte, der KV-Cache und Aktivierungen von beiden ohne Kopierschritt genutzt werden können — eine Hardware-Eigenschaft, die sich vom getrennten Setup aus CPU-RAM und GPU-VRAM auf den meisten Windows-/Linux-Systemen unterscheidet.

Kann MLX-LM Modelle feintunen?

Ja. Es unterstützt sowohl LoRA (Low-Rank) als auch vollständiges Fine-Tuning, einschließlich des Fine-Tunings bereits quantisierter Modelle.

Funktioniert MLX-LM mit Hugging-Face-Modellen?

Ja. MLX-LM integriert sich mit dem Hugging Face Hub zum Herunterladen von Modellen und kann quantisierte Modelle zurück in den Hub hochladen.

Wer entwickelt MLX-LM?

Apple Machine Learning Research entwickelt und pflegt MLX-LM, zusammen mit dem übergeordneten MLX-Framework, auf dem es aufbaut. MLX erschien erstmals am 5. Dezember 2023.

Wie unterscheidet sich MLX-LM von llama.cpp auf einem Mac?

Beide können Modelle auf Apple Silicon ausführen, aber MLX-LM ist Apples eigenes Framework, speziell um Unified Memory herum gebaut und exklusiv für Apple Silicon, während llama.cpp ein separates, plattformübergreifendes Projekt ist, das über sein Metal-Backend auf dem Mac zusätzlich NVIDIA-, AMD- und Intel-Hardware unterstützt.

Kann MLX-LM Modelle über eine API bereitstellen?

Ja. Der Befehl mlx_lm.server startet einen lokalen Server für programmatischen Zugriff auf ein geladenes Modell.

Ist MLX-LM gut für hochdurchsatzstarkes Produktions-Serving geeignet?

Nicht sein primäres Designziel. Für hochdurchsatzstarkes Multi-User-Produktions-Serving sind vLLM oder SGLang die spezialisierteren Werkzeuge; MLX-LM konzentriert sich auf Inferenz und Fine-Tuning auf einer einzelnen Apple-Silicon-Maschine.

Quellen

← Zurück zu Lokale LLMs Pro