Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Docker Model Runner Review 2026: Lokale LLMs über die Docker-CLI
Overview & Reference

Docker Model Runner Review 2026: Lokale LLMs über die Docker-CLI

·11 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Docker Model Runner ist eine Funktion von Docker Desktop und Docker Engine, keine separate herunterladbare App, mit der Sie große Sprachmodelle über docker model-CLI-Befehle abrufen und ausführen können. Die lokale Inferenz läuft über llama.cpp (CPU und Apple Silicon) oder vLLM (NVIDIA-GPU, für höheren Durchsatz beim Serving) — und, das Detail, das die meisten Reviews übersehen: Diese Inferenz-Engine läuft als nativer Host-Prozess, nicht innerhalb eines Containers, wodurch sie direkten Zugriff auf die GPU-Hardware erhält, statt über die Container-Isolation zu gehen. Docker Model Runner stellt eine OpenAI-kompatible API bereit und ist als Teil von Docker Desktop kostenlos enthalten; ob Docker Desktop selbst kostenlos ist, hängt von der Größe Ihrer Organisation ab (siehe Preise unten).

Docker Model Runner ist eine in Docker Desktop und Docker Engine integrierte Funktion, die große Sprachmodelle lokal über docker model-CLI-Befehle ausführt, unterstützt von llama.cpp oder vLLM, und über eine OpenAI-kompatible API bereitgestellt wird. Es handelt sich nicht um eine eigenständige App — es ist eine Funktion, die Docker Desktop hinzugefügt wurde, und läuft daher kostenlos mit demselben Docker Desktop, das die meisten Entwickler bereits installiert haben. Diese Review behandelt, was Docker Model Runner tatsächlich tut, wie es Modelle ausführt, ohne die Inferenz in einen Container zu verlagern, wie man es installiert und nutzt, und wo es sich im Vergleich zu anderen lokalen Runtime-Tools wie Ollama und llama.cpp einordnet.

Docker Model Runner Review 2026: Lokale LLMs über die Docker-CLI

Wichtigste Erkenntnisse

  • Fest in Docker Desktop (macOS, Windows) und Docker Engine (Linux) integriert — kein separater Download
  • Lokale Inferenz-Engine ist llama.cpp für CPU/Apple Silicon oder vLLM für NVIDIA-GPU-gestütztes Serving
  • Läuft als nativer Host-Prozess außerhalb der Container-Laufzeitumgebung, für direkten GPU-Zugriff
  • CLI: docker model pull <modell>, docker model run <modell>, docker model list
  • OpenAI-kompatible API unter http://localhost:12434/engines/v1 vom Host aus, bzw. http://model-runner.docker.internal/engines/v1 aus einem anderen Container
  • Modelle stammen aus dem KI-Modellkatalog von Docker Hub, anderen OCI-kompatiblen Registries oder von Hugging Face
  • Keine zusätzlichen Kosten — die Funktion ist Teil von Docker Desktop; ob Docker Desktop selbst ein kostenpflichtiges Abonnement benötigt, hängt von der Unternehmensgröße ab

📍 In einem Satz

Docker Model Runner ist eine in Docker Desktop und Docker Engine integrierte Funktion, die LLMs lokal über docker model-CLI-Befehle ausführt, mit llama.cpp oder vLLM als Inferenz-Engine, die als nativer Host-Prozess läuft, und eine OpenAI-kompatible API bereitstellt.

💬 In einfachen Worten

Wenn Sie Docker bereits zum Ausführen von Containern nutzen, können Sie mit Docker Model Runner ein KI-Modell auf dieselbe Weise abrufen und starten — docker model pull und docker model run — ohne eine separate Chat-App zu installieren, und ohne dass das Modell tatsächlich in einem Container läuft.

📌Hinweis: Diese Review ist das vertiefende Begleitstück zum Eintrag von Docker Model Runner im lokalen KI-Software-Verzeichnis — dort finden Sie einen schnellen Überblick, wie es im Vergleich zu Dutzenden anderer lokaler KI-Tools abschneidet.

Was ist Docker Model Runner?

Docker Model Runner ist eine Funktion von Docker Desktop und Docker Engine zum Abrufen und Ausführen großer Sprachmodelle lokal, über dieselbe docker-CLI, die Entwickler bereits für Container verwenden. Laut Dockers eigener Produktseite bietet sie lokal-first Inferenz mit einer OpenAI-kompatiblen API und lädt Modelle aus Docker Hub, anderen OCI-kompatiblen Registries oder Hugging Face herunter. Es handelt sich nicht um eine Chat-Anwendung mit grafischem Fenster — es ist eine CLI-Funktion plus ein lokaler Inferenz-Server, gedacht für die Nutzung über ein Terminal, über Docker Compose oder über Code, der die API aufruft.

  • Ist Teil von Docker Desktop (macOS, Windows) und als docker-model-plugin-Paket für Docker Engine unter Linux enthalten — kein separater Installer
  • Lokale Inferenz-Engines: llama.cpp für CPU und Apple Silicon, vLLM für NVIDIA-GPU-gestütztes Serving, laut Dockers Dokumentation
  • Modellquellen: der kuratierte KI-Modellkatalog von Docker Hub, jede OCI-kompatible Registry oder Hugging Face
  • Integriert sich in Tools, die Entwickler rund um Docker bereits nutzen: Docker Compose, Testcontainers und Frameworks wie LangChain, Spring AI und Open WebUI über die OpenAI-kompatible API
  • Entwickler: Docker, Inc.

Installation und erste Schritte

Docker Model Runner ist eine in Docker Desktop und Docker Engine integrierte CLI-Funktion, keine eigenständige herunterladbare App — es gibt daher keinen separaten Installer oder Download-Button. Sie installieren Docker Desktop (oder unter Linux Docker Engine plus das Model-Runner-Plugin), und die docker model-Befehle stehen dann zur Verfügung.

  1. 1
    Installieren Sie Docker Desktop für macOS oder Windows, oder installieren Sie unter Linux Docker Engine plus das Model-Runner-Plugin (sudo apt-get install docker-model-plugin unter Debian/Ubuntu, oder sudo dnf install docker-model-plugin unter Fedora/RHEL).
  2. 2
    Aktivieren Sie Model Runner, falls noch nicht geschehen: docker desktop enable model-runner (Docker Desktop), oder stellen Sie sicher, dass das Plugin unter Docker Engine aktiv ist.
  3. 3
    Laden Sie ein Modell aus dem KI-Katalog von Docker Hub: docker model pull ai/smollm2:360M-Q4_K_M.
  4. 4
    Führen Sie es direkt über die Kommandozeile aus: docker model run ai/smollm2:360M-Q4_K_M "Give me a fact about whales."
  5. 5
    Zeigen Sie jederzeit lokal geladene Modelle mit docker model list an.
  6. 6
    Um das Modell über HTTP statt über die CLI zu erreichen, nutzen Sie die OpenAI-kompatible API — siehe Die OpenAI-kompatible API unten für den genauen Endpunkt.

Warum es als Host-Prozess läuft, nicht in einem Container

Trotz des docker-Befehlspräfixes führt Docker Model Runner die Modell-Inferenz nicht innerhalb eines Containers aus. Dockers eigener Blogbeitrag zur Einführung der Funktion stellt das explizit klar: docker model run "startet keinerlei Container." Stattdessen ruft der Befehl eine Inference-Server-API auf, die von Model Runner über Docker Desktop bereitgestellt wird, und dieser Inference Server führt seine Inferenz-Engine (llama.cpp oder vLLM) als nativen Host-Prozess aus — einen normalen Prozess, der direkt auf Ihrem Betriebssystem läuft, genau wie jedes andere lokal installierte Programm.

  • Der genannte Grund ist der GPU-Zugriff: Ein nativer Host-Prozess kann die GPU Ihres Rechners (die integrierte GPU von Apple Silicon oder eine NVIDIA-GPU) direkt nutzen, ohne den zusätzlichen Umweg über Container-zu-Host-GPU-Passthrough
  • Dies ist eine bewusste Architekturentscheidung für die Performance, keine Einschränkung der Container-Laufzeitumgebung von Docker — Docker Model Runner nutzt Container an anderer Stelle im Workflow (zum Beispiel ist ein Teil der Modellverpackung OCI-basiert), aber nicht für den Inferenz-Prozess selbst
  • Praktisch bedeutet das, dass ein laufendes Modell sich eher wie ein Hintergrunddienst auf Ihrem Rechner verhält als wie ein Container, den Sie mit docker ps inspizieren könnten
  • Modelle bleiben im Speicher geladen, bis entweder ein anderes Modell angefragt wird oder eine Phase der Inaktivität verstreicht — die erste Anfrage nach dem Start ist daher langsamer als nachfolgende

llama.cpp vs. vLLM: Welche Engine Ihr Modell ausführt

Docker Model Runner implementiert keine eigene Inferenz-Engine — es kapselt zwei bestehende Open-Source-Engines und wählt zwischen ihnen basierend auf Ihrer Hardware und dem Modellformat, laut Dockers Dokumentation.

llama.cpp

Einsatzzweck:
Lokale Entwicklung, ressourcenschonende Inferenz
Modellformat:
GGUF (quantisiert)
Plattformen:
CPU und Apple Silicon; zudem Windows-/Linux-GPU-Backends

vLLM

Einsatzzweck:
Produktionsorientiertes Serving mit höherem Durchsatz
Modellformat:
Safetensors
Plattformen:
Linux und Windows (WSL2) mit NVIDIA-GPU

Dies ist dieselbe llama.cpp-Engine, die im llama.cpp-Erklärartikel dieser Seite ausführlich behandelt wird, und dieselbe vLLM-Engine aus dem vLLM-Erklärartikel — Docker Model Runner ist eine Verpackungs- und CLI-Schicht über diesen Engines, keine grundlegend neue Alternative zu einer von beiden. Docker dokumentiert zudem experimentelle Diffusers-Unterstützung für Bildgenerierungsmodelle (Stable Diffusion) unter Linux mit NVIDIA-GPUs, was außerhalb des Fokus dieser LLM-zentrierten Review liegt.

Die OpenAI-kompatible API

Docker Model Runner stellt eine OpenAI-kompatible HTTP-API bereit, sodass bestehender OpenAI-Client-Code auf ein lokales Modell statt auf einen Cloud-Endpunkt zeigen kann, laut Dockers Blogbeitrag zur Funktion.

  • Vom Host-Rechner aus: http://localhost:12434/engines/v1 (der TCP-Zugriff muss einmalig mit docker desktop enable model-runner --tcp 12434 aktiviert werden)
  • Aus einem anderen Container im selben Docker-Netzwerk: http://model-runner.docker.internal/engines/v1
  • Kompatibel mit Tools und Frameworks, die bereits für das OpenAI-API-Format gebaut wurden, darunter LangChain, Spring AI und Open WebUI, laut Dockers eigenen Integrationsbeispielen
  • Modelle werden bei Eintreffen einer Anfrage bei Bedarf geladen und bleiben im Speicher, bis ein anderes Modell angefragt wird oder ein Inaktivitäts-Timeout eintritt

Unterstützte Plattformen

Die Hardware-Unterstützung von Docker Model Runner unterscheidet sich je nach Betriebssystem und verwendeter Inferenz-Engine, laut Dockers Dokumentation.

macOS

Details:
Apple Silicon, über llama.cpp mit nativer GPU-Beschleunigung

Windows

Details:
AMD64 mit NVIDIA-GPU (Treiber 576.57 oder neuer) über llama.cpp oder vLLM (WSL2); ARM64 mit Qualcomm-Adreno-6xx-GPUs über llama.cpp

Linux

Details:
Nur CPU, NVIDIA CUDA, AMD ROCm oder Vulkan-Backends über llama.cpp; NVIDIA-GPU über vLLM (Treiber 575.57.08 oder neuer)

Genaue Mindest-Treiberversionen und unterstützte GPU-Familien ändern sich, wenn Docker die Funktion aktualisiert — prüfen Sie die aktuellen Anforderungen anhand von docs.docker.com/ai/model-runner, bevor Sie eine Bereitstellung um eine bestimmte GPU herum planen.

Docker Model Runner Preise

Docker Model Runner selbst verursacht keine zusätzlichen Kosten — es ist eine in Docker Desktop und Docker Engine enthaltene Funktion. Ob Sie etwas zahlen müssen, hängt vollständig davon ab, ob Ihre Nutzung von Docker Desktop unter Dockers eigener Subscription Service Agreement als kostenlos gilt.

Personal (kostenlos)

Für wen geeignet:
Einzelpersonen, Bildung, nicht-kommerzielle Open-Source-Projekte sowie Unternehmen unter 250 Mitarbeitern und 10 Mio. $ Jahresumsatz
Docker Model Runner enthalten?:
Ja

Pro / Team / Business (kostenpflichtig)

Für wen geeignet:
Größere Unternehmen oder alle, die Team-Funktionen über den Umfang der kostenlosen Stufe hinaus benötigen
Docker Model Runner enthalten?:
Ja

Die kuratierten KI-Modelle von Docker Hub können unabhängig von der Abonnementstufe kostenlos geladen werden. Kostenpflichtige Docker-Pläne (Pro, Team, Business) fügen Funktionen hinzu, die nichts mit Model Runner selbst zu tun haben, etwa Team-Sitze und zentrale Verwaltung — aktuelle Preise finden Sie unter docker.com/pricing, da sich diese unabhängig von der Model-Runner-Funktion ändern.

Für wen eignet sich Docker Model Runner?

Docker Model Runner passt zu einem bestimmten Workflow: Entwickler, die bereits mit Docker arbeiten und lokale LLM-Inferenz hinzufügen möchten, ohne ein zweites Tool in ihren Stack aufzunehmen.

Wettbewerber und Alternativen

Docker Model Runner ordnet sich im Segment lokaler Inferenz-Runtimes ein, neben CLI-first-Engines und Desktop-Apps, die dieselben zugrunde liegenden Engines einbetten. Siehe das lokale KI-Software-Verzeichnis für den vollständigen Katalog.

  • llama.cpp — die Inferenz-Engine, die Docker Model Runner selbst für CPU/Apple Silicon nutzt; die direkte Verwendung gibt Ihnen Kontrolle über Build-Flags und Quantisierung, die Dockers Wrapper nicht offenlegt.
  • vLLM — dieselbe GPU-Serving-Engine, die Docker Model Runner für Produktions-Workloads nutzt; die direkte Verwendung ist die bessere Wahl, wenn Sie den vollen Konfigurationsumfang von vLLM benötigen statt Dockers vereinfachter CLI darüber.
  • Ollama — der nächstliegende Ein-Befehl-Vergleich: Wie Docker Model Runner kapselt Ollama llama.cpp hinter einer einfachen Pull-and-Run-CLI und einer OpenAI-kompatiblen API, jedoch als eigenständiges Tool statt als Docker-Desktop-Funktion — die bessere Wahl, wenn Sie Docker noch nicht nutzen.
  • Jan — eine kostenlose, quelloffene Desktop-App mit grafischem Chat-Fenster auf Basis derselben llama.cpp-Engine, für Entwickler, die statt eines CLI-und-API-Workflows eine Point-and-Click-Oberfläche möchten.
  • GPT4All — eine weitere quelloffene, llama.cpp-basierte lokale Chat-App, für denselben "Ich möchte ein Fenster, kein Terminal"-Anwendungsfall wie Jan.

Häufige Fehler

Die meiste Verwirrung rund um Docker Model Runner entsteht durch die Annahme, es verhalte sich wie eine gewöhnliche Docker-Container-Arbeitslast, oder durch das Übersehen, dass es eine Docker-Desktop-Funktion ist und kein separat zu installierendes Produkt.

Häufig gestellte Fragen

Was ist Docker Model Runner?

Docker Model Runner ist eine in Docker Desktop und Docker Engine integrierte Funktion, die große Sprachmodelle lokal über docker model-CLI-Befehle ausführt, mit llama.cpp oder vLLM als Inferenz-Engine und einer OpenAI-kompatiblen API.

Ist Docker Model Runner kostenlos?

Die Funktion selbst verursacht keine zusätzlichen Kosten — sie ist Teil von Docker Desktop und Docker Engine. Ob Sie ein kostenpflichtiges Docker-Abonnement benötigen, hängt von der Größe Ihrer Organisation ab: Docker Desktop ist kostenlos für Einzelpersonen, nicht-kommerzielle Open-Source-Projekte sowie Unternehmen mit weniger als 250 Mitarbeitern und unter 10 Millionen US-Dollar Jahresumsatz, laut Dockers Subscription Service Agreement.

Führt Docker Model Runner Modelle innerhalb eines Containers aus?

Nein. Trotz des docker model-Befehlspräfixes läuft die Inferenz-Engine (llama.cpp oder vLLM) als nativer Host-Prozess außerhalb der Container-Laufzeitumgebung, laut Dockers eigenem Blogbeitrag zur Einführung der Funktion — das ermöglicht direkten Zugriff auf die GPU-Hardware, statt über die Container-Isolation zu gehen.

Welche CLI-Befehle verwendet Docker Model Runner?

Die zentralen Befehle sind docker model pull <modell> zum Herunterladen eines Modells, docker model run <modell> zum Ausführen der Inferenz über die Kommandozeile und docker model list zur Anzeige bereits lokal geladener Modelle.

Was ist der API-Endpunkt von Docker Model Runner?

Eine OpenAI-kompatible API wird unter http://localhost:12434/engines/v1 vom Host-Rechner aus bereitgestellt (nach einmaliger Aktivierung des TCP-Zugriffs), bzw. unter http://model-runner.docker.internal/engines/v1 aus einem anderen Container im selben Docker-Netzwerk.

Nutzt Docker Model Runner llama.cpp oder vLLM?

Beides, je nach Situation. llama.cpp übernimmt CPU- und Apple-Silicon-Inferenz für die lokale Entwicklung; vLLM übernimmt NVIDIA-GPU-gestütztes Serving unter Linux und Windows WSL2, ausgelegt auf höheren Durchsatz im Produktionseinsatz.

Welche Plattformen unterstützt Docker Model Runner?

macOS auf Apple Silicon; Windows auf AMD64 mit NVIDIA-GPU oder ARM64 mit einer Qualcomm-Adreno-6xx-GPU; sowie Linux mit reinen CPU-, NVIDIA-CUDA-, AMD-ROCm- oder Vulkan-Backends. Details finden Sie im Abschnitt Unterstützte Plattformen oben.

Wie unterscheidet sich Docker Model Runner von Ollama?

Beide kapseln llama.cpp hinter einer einfachen Pull-and-Run-CLI und einer OpenAI-kompatiblen API. Der Hauptunterschied liegt in der Verpackung: Ollama ist ein eigenständiges Tool, das Sie separat installieren, während Docker Model Runner eine Funktion von Docker Desktop/Engine ist — die bessere Wahl, wenn Sie Docker bereits täglich nutzen, da kein zweites Tool zu Ihrem Workflow hinzukommt.

Woher stammen die Modelle von Docker Model Runner?

Modelle können aus dem kuratierten KI-Modellkatalog von Docker Hub, jeder anderen OCI-kompatiblen Registry oder von Hugging Face geladen werden, laut Dockers Produktseite.

Quellen

← Zurück zu Lokale LLMs Pro