Wichtigste Erkenntnisse
- Fest in Docker Desktop (macOS, Windows) und Docker Engine (Linux) integriert — kein separater Download
- Lokale Inferenz-Engine ist llama.cpp für CPU/Apple Silicon oder vLLM für NVIDIA-GPU-gestütztes Serving
- Läuft als nativer Host-Prozess außerhalb der Container-Laufzeitumgebung, für direkten GPU-Zugriff
- CLI:
docker model pull <modell>,docker model run <modell>,docker model list - OpenAI-kompatible API unter
http://localhost:12434/engines/v1vom Host aus, bzw.http://model-runner.docker.internal/engines/v1aus einem anderen Container - Modelle stammen aus dem KI-Modellkatalog von Docker Hub, anderen OCI-kompatiblen Registries oder von Hugging Face
- Keine zusätzlichen Kosten — die Funktion ist Teil von Docker Desktop; ob Docker Desktop selbst ein kostenpflichtiges Abonnement benötigt, hängt von der Unternehmensgröße ab
📍 In einem Satz
Docker Model Runner ist eine in Docker Desktop und Docker Engine integrierte Funktion, die LLMs lokal über docker model-CLI-Befehle ausführt, mit llama.cpp oder vLLM als Inferenz-Engine, die als nativer Host-Prozess läuft, und eine OpenAI-kompatible API bereitstellt.
💬 In einfachen Worten
Wenn Sie Docker bereits zum Ausführen von Containern nutzen, können Sie mit Docker Model Runner ein KI-Modell auf dieselbe Weise abrufen und starten — docker model pull und docker model run — ohne eine separate Chat-App zu installieren, und ohne dass das Modell tatsächlich in einem Container läuft.
📌Hinweis: Diese Review ist das vertiefende Begleitstück zum Eintrag von Docker Model Runner im lokalen KI-Software-Verzeichnis — dort finden Sie einen schnellen Überblick, wie es im Vergleich zu Dutzenden anderer lokaler KI-Tools abschneidet.
Was ist Docker Model Runner?
Docker Model Runner ist eine Funktion von Docker Desktop und Docker Engine zum Abrufen und Ausführen großer Sprachmodelle lokal, über dieselbe docker-CLI, die Entwickler bereits für Container verwenden. Laut Dockers eigener Produktseite bietet sie lokal-first Inferenz mit einer OpenAI-kompatiblen API und lädt Modelle aus Docker Hub, anderen OCI-kompatiblen Registries oder Hugging Face herunter. Es handelt sich nicht um eine Chat-Anwendung mit grafischem Fenster — es ist eine CLI-Funktion plus ein lokaler Inferenz-Server, gedacht für die Nutzung über ein Terminal, über Docker Compose oder über Code, der die API aufruft.
- Ist Teil von Docker Desktop (macOS, Windows) und als
docker-model-plugin-Paket für Docker Engine unter Linux enthalten — kein separater Installer - Lokale Inferenz-Engines: llama.cpp für CPU und Apple Silicon, vLLM für NVIDIA-GPU-gestütztes Serving, laut Dockers Dokumentation
- Modellquellen: der kuratierte KI-Modellkatalog von Docker Hub, jede OCI-kompatible Registry oder Hugging Face
- Integriert sich in Tools, die Entwickler rund um Docker bereits nutzen: Docker Compose, Testcontainers und Frameworks wie LangChain, Spring AI und Open WebUI über die OpenAI-kompatible API
- Entwickler: Docker, Inc.
Installation und erste Schritte
Docker Model Runner ist eine in Docker Desktop und Docker Engine integrierte CLI-Funktion, keine eigenständige herunterladbare App — es gibt daher keinen separaten Installer oder Download-Button. Sie installieren Docker Desktop (oder unter Linux Docker Engine plus das Model-Runner-Plugin), und die docker model-Befehle stehen dann zur Verfügung.
- 1Installieren Sie Docker Desktop für macOS oder Windows, oder installieren Sie unter Linux Docker Engine plus das Model-Runner-Plugin (
sudo apt-get install docker-model-pluginunter Debian/Ubuntu, odersudo dnf install docker-model-pluginunter Fedora/RHEL). - 2Aktivieren Sie Model Runner, falls noch nicht geschehen:
docker desktop enable model-runner(Docker Desktop), oder stellen Sie sicher, dass das Plugin unter Docker Engine aktiv ist. - 3Laden Sie ein Modell aus dem KI-Katalog von Docker Hub:
docker model pull ai/smollm2:360M-Q4_K_M. - 4Führen Sie es direkt über die Kommandozeile aus:
docker model run ai/smollm2:360M-Q4_K_M "Give me a fact about whales." - 5Zeigen Sie jederzeit lokal geladene Modelle mit
docker model listan. - 6Um das Modell über HTTP statt über die CLI zu erreichen, nutzen Sie die OpenAI-kompatible API — siehe Die OpenAI-kompatible API unten für den genauen Endpunkt.
Warum es als Host-Prozess läuft, nicht in einem Container
Trotz des docker-Befehlspräfixes führt Docker Model Runner die Modell-Inferenz nicht innerhalb eines Containers aus. Dockers eigener Blogbeitrag zur Einführung der Funktion stellt das explizit klar: docker model run "startet keinerlei Container." Stattdessen ruft der Befehl eine Inference-Server-API auf, die von Model Runner über Docker Desktop bereitgestellt wird, und dieser Inference Server führt seine Inferenz-Engine (llama.cpp oder vLLM) als nativen Host-Prozess aus — einen normalen Prozess, der direkt auf Ihrem Betriebssystem läuft, genau wie jedes andere lokal installierte Programm.
- Der genannte Grund ist der GPU-Zugriff: Ein nativer Host-Prozess kann die GPU Ihres Rechners (die integrierte GPU von Apple Silicon oder eine NVIDIA-GPU) direkt nutzen, ohne den zusätzlichen Umweg über Container-zu-Host-GPU-Passthrough
- Dies ist eine bewusste Architekturentscheidung für die Performance, keine Einschränkung der Container-Laufzeitumgebung von Docker — Docker Model Runner nutzt Container an anderer Stelle im Workflow (zum Beispiel ist ein Teil der Modellverpackung OCI-basiert), aber nicht für den Inferenz-Prozess selbst
- Praktisch bedeutet das, dass ein laufendes Modell sich eher wie ein Hintergrunddienst auf Ihrem Rechner verhält als wie ein Container, den Sie mit
docker psinspizieren könnten - Modelle bleiben im Speicher geladen, bis entweder ein anderes Modell angefragt wird oder eine Phase der Inaktivität verstreicht — die erste Anfrage nach dem Start ist daher langsamer als nachfolgende
llama.cpp vs. vLLM: Welche Engine Ihr Modell ausführt
Docker Model Runner implementiert keine eigene Inferenz-Engine — es kapselt zwei bestehende Open-Source-Engines und wählt zwischen ihnen basierend auf Ihrer Hardware und dem Modellformat, laut Dockers Dokumentation.
llama.cpp
- Einsatzzweck:
- Lokale Entwicklung, ressourcenschonende Inferenz
- Modellformat:
- GGUF (quantisiert)
- Plattformen:
- CPU und Apple Silicon; zudem Windows-/Linux-GPU-Backends
vLLM
- Einsatzzweck:
- Produktionsorientiertes Serving mit höherem Durchsatz
- Modellformat:
- Safetensors
- Plattformen:
- Linux und Windows (WSL2) mit NVIDIA-GPU
Dies ist dieselbe llama.cpp-Engine, die im llama.cpp-Erklärartikel dieser Seite ausführlich behandelt wird, und dieselbe vLLM-Engine aus dem vLLM-Erklärartikel — Docker Model Runner ist eine Verpackungs- und CLI-Schicht über diesen Engines, keine grundlegend neue Alternative zu einer von beiden. Docker dokumentiert zudem experimentelle Diffusers-Unterstützung für Bildgenerierungsmodelle (Stable Diffusion) unter Linux mit NVIDIA-GPUs, was außerhalb des Fokus dieser LLM-zentrierten Review liegt.
Die OpenAI-kompatible API
Docker Model Runner stellt eine OpenAI-kompatible HTTP-API bereit, sodass bestehender OpenAI-Client-Code auf ein lokales Modell statt auf einen Cloud-Endpunkt zeigen kann, laut Dockers Blogbeitrag zur Funktion.
- Vom Host-Rechner aus:
http://localhost:12434/engines/v1(der TCP-Zugriff muss einmalig mitdocker desktop enable model-runner --tcp 12434aktiviert werden) - Aus einem anderen Container im selben Docker-Netzwerk:
http://model-runner.docker.internal/engines/v1 - Kompatibel mit Tools und Frameworks, die bereits für das OpenAI-API-Format gebaut wurden, darunter LangChain, Spring AI und Open WebUI, laut Dockers eigenen Integrationsbeispielen
- Modelle werden bei Eintreffen einer Anfrage bei Bedarf geladen und bleiben im Speicher, bis ein anderes Modell angefragt wird oder ein Inaktivitäts-Timeout eintritt
Unterstützte Plattformen
Die Hardware-Unterstützung von Docker Model Runner unterscheidet sich je nach Betriebssystem und verwendeter Inferenz-Engine, laut Dockers Dokumentation.
macOS
- Details:
- Apple Silicon, über llama.cpp mit nativer GPU-Beschleunigung
Windows
- Details:
- AMD64 mit NVIDIA-GPU (Treiber 576.57 oder neuer) über llama.cpp oder vLLM (WSL2); ARM64 mit Qualcomm-Adreno-6xx-GPUs über llama.cpp
Linux
- Details:
- Nur CPU, NVIDIA CUDA, AMD ROCm oder Vulkan-Backends über llama.cpp; NVIDIA-GPU über vLLM (Treiber 575.57.08 oder neuer)
Genaue Mindest-Treiberversionen und unterstützte GPU-Familien ändern sich, wenn Docker die Funktion aktualisiert — prüfen Sie die aktuellen Anforderungen anhand von docs.docker.com/ai/model-runner, bevor Sie eine Bereitstellung um eine bestimmte GPU herum planen.
Docker Model Runner Preise
Docker Model Runner selbst verursacht keine zusätzlichen Kosten — es ist eine in Docker Desktop und Docker Engine enthaltene Funktion. Ob Sie etwas zahlen müssen, hängt vollständig davon ab, ob Ihre Nutzung von Docker Desktop unter Dockers eigener Subscription Service Agreement als kostenlos gilt.
Personal (kostenlos)
- Für wen geeignet:
- Einzelpersonen, Bildung, nicht-kommerzielle Open-Source-Projekte sowie Unternehmen unter 250 Mitarbeitern und 10 Mio. $ Jahresumsatz
- Docker Model Runner enthalten?:
- Ja
Pro / Team / Business (kostenpflichtig)
- Für wen geeignet:
- Größere Unternehmen oder alle, die Team-Funktionen über den Umfang der kostenlosen Stufe hinaus benötigen
- Docker Model Runner enthalten?:
- Ja
Die kuratierten KI-Modelle von Docker Hub können unabhängig von der Abonnementstufe kostenlos geladen werden. Kostenpflichtige Docker-Pläne (Pro, Team, Business) fügen Funktionen hinzu, die nichts mit Model Runner selbst zu tun haben, etwa Team-Sitze und zentrale Verwaltung — aktuelle Preise finden Sie unter docker.com/pricing, da sich diese unabhängig von der Model-Runner-Funktion ändern.
Für wen eignet sich Docker Model Runner?
Docker Model Runner passt zu einem bestimmten Workflow: Entwickler, die bereits mit Docker arbeiten und lokale LLM-Inferenz hinzufügen möchten, ohne ein zweites Tool in ihren Stack aufzunehmen.
Wettbewerber und Alternativen
Docker Model Runner ordnet sich im Segment lokaler Inferenz-Runtimes ein, neben CLI-first-Engines und Desktop-Apps, die dieselben zugrunde liegenden Engines einbetten. Siehe das lokale KI-Software-Verzeichnis für den vollständigen Katalog.
- llama.cpp — die Inferenz-Engine, die Docker Model Runner selbst für CPU/Apple Silicon nutzt; die direkte Verwendung gibt Ihnen Kontrolle über Build-Flags und Quantisierung, die Dockers Wrapper nicht offenlegt.
- vLLM — dieselbe GPU-Serving-Engine, die Docker Model Runner für Produktions-Workloads nutzt; die direkte Verwendung ist die bessere Wahl, wenn Sie den vollen Konfigurationsumfang von vLLM benötigen statt Dockers vereinfachter CLI darüber.
- Ollama — der nächstliegende Ein-Befehl-Vergleich: Wie Docker Model Runner kapselt Ollama llama.cpp hinter einer einfachen Pull-and-Run-CLI und einer OpenAI-kompatiblen API, jedoch als eigenständiges Tool statt als Docker-Desktop-Funktion — die bessere Wahl, wenn Sie Docker noch nicht nutzen.
- Jan — eine kostenlose, quelloffene Desktop-App mit grafischem Chat-Fenster auf Basis derselben llama.cpp-Engine, für Entwickler, die statt eines CLI-und-API-Workflows eine Point-and-Click-Oberfläche möchten.
- GPT4All — eine weitere quelloffene, llama.cpp-basierte lokale Chat-App, für denselben "Ich möchte ein Fenster, kein Terminal"-Anwendungsfall wie Jan.
Häufige Fehler
Die meiste Verwirrung rund um Docker Model Runner entsteht durch die Annahme, es verhalte sich wie eine gewöhnliche Docker-Container-Arbeitslast, oder durch das Übersehen, dass es eine Docker-Desktop-Funktion ist und kein separat zu installierendes Produkt.
Häufig gestellte Fragen
Was ist Docker Model Runner?
Docker Model Runner ist eine in Docker Desktop und Docker Engine integrierte Funktion, die große Sprachmodelle lokal über docker model-CLI-Befehle ausführt, mit llama.cpp oder vLLM als Inferenz-Engine und einer OpenAI-kompatiblen API.
Ist Docker Model Runner kostenlos?
Die Funktion selbst verursacht keine zusätzlichen Kosten — sie ist Teil von Docker Desktop und Docker Engine. Ob Sie ein kostenpflichtiges Docker-Abonnement benötigen, hängt von der Größe Ihrer Organisation ab: Docker Desktop ist kostenlos für Einzelpersonen, nicht-kommerzielle Open-Source-Projekte sowie Unternehmen mit weniger als 250 Mitarbeitern und unter 10 Millionen US-Dollar Jahresumsatz, laut Dockers Subscription Service Agreement.
Führt Docker Model Runner Modelle innerhalb eines Containers aus?
Nein. Trotz des docker model-Befehlspräfixes läuft die Inferenz-Engine (llama.cpp oder vLLM) als nativer Host-Prozess außerhalb der Container-Laufzeitumgebung, laut Dockers eigenem Blogbeitrag zur Einführung der Funktion — das ermöglicht direkten Zugriff auf die GPU-Hardware, statt über die Container-Isolation zu gehen.
Welche CLI-Befehle verwendet Docker Model Runner?
Die zentralen Befehle sind docker model pull <modell> zum Herunterladen eines Modells, docker model run <modell> zum Ausführen der Inferenz über die Kommandozeile und docker model list zur Anzeige bereits lokal geladener Modelle.
Was ist der API-Endpunkt von Docker Model Runner?
Eine OpenAI-kompatible API wird unter http://localhost:12434/engines/v1 vom Host-Rechner aus bereitgestellt (nach einmaliger Aktivierung des TCP-Zugriffs), bzw. unter http://model-runner.docker.internal/engines/v1 aus einem anderen Container im selben Docker-Netzwerk.
Nutzt Docker Model Runner llama.cpp oder vLLM?
Beides, je nach Situation. llama.cpp übernimmt CPU- und Apple-Silicon-Inferenz für die lokale Entwicklung; vLLM übernimmt NVIDIA-GPU-gestütztes Serving unter Linux und Windows WSL2, ausgelegt auf höheren Durchsatz im Produktionseinsatz.
Welche Plattformen unterstützt Docker Model Runner?
macOS auf Apple Silicon; Windows auf AMD64 mit NVIDIA-GPU oder ARM64 mit einer Qualcomm-Adreno-6xx-GPU; sowie Linux mit reinen CPU-, NVIDIA-CUDA-, AMD-ROCm- oder Vulkan-Backends. Details finden Sie im Abschnitt Unterstützte Plattformen oben.
Wie unterscheidet sich Docker Model Runner von Ollama?
Beide kapseln llama.cpp hinter einer einfachen Pull-and-Run-CLI und einer OpenAI-kompatiblen API. Der Hauptunterschied liegt in der Verpackung: Ollama ist ein eigenständiges Tool, das Sie separat installieren, während Docker Model Runner eine Funktion von Docker Desktop/Engine ist — die bessere Wahl, wenn Sie Docker bereits täglich nutzen, da kein zweites Tool zu Ihrem Workflow hinzukommt.
Woher stammen die Modelle von Docker Model Runner?
Modelle können aus dem kuratierten KI-Modellkatalog von Docker Hub, jeder anderen OCI-kompatiblen Registry oder von Hugging Face geladen werden, laut Dockers Produktseite.
