Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Docker Model Runner : avis 2026 sur les LLM locaux via la CLI Docker
Overview & Reference

Docker Model Runner : avis 2026 sur les LLM locaux via la CLI Docker

·11 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Docker Model Runner est une fonctionnalité de Docker Desktop et de Docker Engine, pas une application distincte à télécharger, qui permet de récupérer et d'exécuter des grands modèles de langage avec des commandes CLI docker model. L'inférence locale s'exécute via llama.cpp (CPU et Apple Silicon) ou vLLM (GPU NVIDIA, pour un service à débit plus élevé) — et, le détail que la plupart des avis manquent, ce moteur d'inférence s'exécute comme un processus natif de l'hôte, pas dans un conteneur, ce qui lui permet d'accéder directement au matériel GPU plutôt que de passer par l'isolation des conteneurs. Docker Model Runner expose une API compatible OpenAI et est inclus gratuitement dans Docker Desktop ; la gratuité de Docker Desktop lui-même dépend de la taille de votre organisation (voir Tarifs ci-dessous).

Docker Model Runner est une fonctionnalité intégrée à Docker Desktop et à Docker Engine qui exécute des grands modèles de langage en local via des commandes CLI docker model, s'appuyant sur llama.cpp ou vLLM, et exposée via une API compatible OpenAI. Ce n'est pas une application autonome : c'est une capacité ajoutée à Docker Desktop, livrée gratuitement avec le Docker Desktop que la plupart des développeurs ont déjà installé. Cet avis couvre ce que fait réellement Docker Model Runner, comment il exécute des modèles sans faire tourner l'inférence dans un conteneur, comment l'installer et l'utiliser, et sa place face à d'autres runtimes locaux comme Ollama et llama.cpp.

Docker Model Runner : avis 2026 sur les LLM locaux via la CLI Docker

Points clés

  • Intégré à Docker Desktop (macOS, Windows) et Docker Engine (Linux) — pas un téléchargement séparé
  • Le moteur d'inférence local est llama.cpp pour CPU/Apple Silicon ou vLLM pour un service adossé à un GPU NVIDIA
  • S'exécute comme un processus natif de l'hôte en dehors du runtime de conteneurs, pour un accès direct au GPU
  • CLI : docker model pull <modèle>, docker model run <modèle>, docker model list
  • API compatible OpenAI sur http://localhost:12434/engines/v1 depuis l'hôte, ou http://model-runner.docker.internal/engines/v1 depuis un autre conteneur
  • Les modèles proviennent du catalogue de modèles IA de Docker Hub, d'autres registres compatibles OCI, ou de Hugging Face
  • Aucun coût supplémentaire — la fonctionnalité est livrée avec Docker Desktop ; la nécessité d'un abonnement payant pour Docker Desktop lui-même dépend de la taille de l'entreprise

📍 En une phrase

Docker Model Runner est une fonctionnalité intégrée à Docker Desktop et Docker Engine qui exécute des LLM en local via des commandes CLI docker model, avec llama.cpp ou vLLM comme moteur d'inférence tournant comme un processus natif de l'hôte, et exposant une API compatible OpenAI.

💬 En termes simples

Si vous utilisez déjà Docker pour exécuter des conteneurs, Docker Model Runner vous permet de récupérer et d'exécuter un modèle d'IA de la même façon — docker model pull et docker model run — sans installer une application de chat séparée, et sans que le modèle tourne réellement dans un conteneur.

📌Remarque: Cet avis est le complément détaillé de la fiche de Docker Model Runner dans le Répertoire des logiciels d'IA locale — consultez cette page pour voir en un coup d'œil comment il se compare à des dizaines d'autres outils d'IA locale.

Qu'est-ce que Docker Model Runner ?

Docker Model Runner est une fonctionnalité de Docker Desktop et de Docker Engine permettant de récupérer et d'exécuter des grands modèles de langage en local, via la même CLI docker que les développeurs utilisent déjà pour les conteneurs. Selon la page produit officielle de Docker, elle offre une inférence local-first avec une API compatible OpenAI, en récupérant des modèles depuis Docker Hub, d'autres registres compatibles OCI, ou Hugging Face. Ce n'est pas une application de chat avec une fenêtre graphique — c'est une fonctionnalité CLI plus un serveur d'inférence local, destinée à être utilisée depuis un terminal, depuis Docker Compose, ou depuis du code appelant son API.

  • Livré dans Docker Desktop (macOS, Windows) et comme paquet docker-model-plugin pour Docker Engine sous Linux — pas un installateur séparé
  • Moteurs d'inférence locaux : llama.cpp pour CPU et Apple Silicon, vLLM pour un service adossé à un GPU NVIDIA, selon la documentation de Docker
  • Sources de modèles : le catalogue IA de Docker Hub, tout registre compatible OCI, ou Hugging Face
  • S'intègre aux outils que les développeurs utilisent déjà autour de Docker : Docker Compose, Testcontainers, et des frameworks comme LangChain, Spring AI et Open WebUI via l'API compatible OpenAI
  • Éditeur : Docker, Inc.

Installation et prise en main

Docker Model Runner est une fonctionnalité CLI intégrée à Docker Desktop et Docker Engine, pas une application autonome à télécharger — il n'y a donc pas d'installateur séparé ni de bouton de téléchargement. Vous installez Docker Desktop (ou, sous Linux, Docker Engine plus le plugin model-runner), et les commandes docker model deviennent disponibles.

  1. 1
    Installez Docker Desktop pour macOS ou Windows, ou installez sous Linux Docker Engine plus le plugin model-runner (sudo apt-get install docker-model-plugin sous Debian/Ubuntu, ou sudo dnf install docker-model-plugin sous Fedora/RHEL).
  2. 2
    Activez Model Runner s'il ne l'est pas déjà : docker desktop enable model-runner (Docker Desktop), ou assurez-vous que le plugin est actif sur Docker Engine.
  3. 3
    Récupérez un modèle depuis le catalogue IA de Docker Hub : docker model pull ai/smollm2:360M-Q4_K_M.
  4. 4
    Exécutez-le directement en ligne de commande : docker model run ai/smollm2:360M-Q4_K_M "Give me a fact about whales."
  5. 5
    Listez à tout moment les modèles déjà récupérés localement avec docker model list.
  6. 6
    Pour joindre le modèle via HTTP plutôt que via la CLI, utilisez l'API compatible OpenAI — voir L'API compatible OpenAI ci-dessous pour le point d'accès exact.

Pourquoi il s'exécute comme processus de l'hôte, pas dans un conteneur

Malgré le préfixe de commande docker, Docker Model Runner n'exécute pas l'inférence du modèle dans un conteneur. Le billet de blog officiel de Docker présentant la fonctionnalité est explicite à ce sujet : exécuter docker model run « ne démarre aucun conteneur ». À la place, la commande appelle une API de serveur d'inférence hébergée par Model Runner via Docker Desktop, et ce serveur d'inférence exécute son moteur (llama.cpp ou vLLM) comme un processus natif de l'hôte — un processus normal qui tourne directement sur votre système d'exploitation, comme n'importe quel autre programme installé localement.

  • La raison invoquée est l'accès au GPU : un processus natif de l'hôte peut utiliser directement le GPU de votre machine (le GPU intégré d'Apple Silicon, ou un GPU NVIDIA), sans l'indirection supplémentaire du passage GPU conteneur-vers-hôte
  • C'est un choix d'architecture délibéré pour la performance, pas une limitation du runtime de conteneurs de Docker — Docker Model Runner utilise des conteneurs ailleurs dans son flux de travail (par exemple, une partie de l'empaquetage des modèles est basée sur OCI) mais pas pour le processus d'inférence lui-même
  • En pratique, cela signifie qu'un modèle en cours d'exécution se comporte davantage comme un service en arrière-plan sur votre machine que comme un conteneur que vous pourriez inspecter avec docker ps
  • Les modèles restent chargés en mémoire jusqu'à ce qu'un autre modèle soit demandé ou qu'une période d'inactivité s'écoule, donc la première requête après le démarrage est plus lente que les suivantes

llama.cpp vs. vLLM : quel moteur exécute votre modèle

Docker Model Runner n'implémente pas son propre moteur d'inférence — il encapsule deux moteurs open source existants et choisit entre eux selon votre matériel et le format du modèle, selon la documentation de Docker.

llama.cpp

Utilisation:
Développement local, inférence économe en ressources
Format du modèle:
GGUF (quantifié)
Plateformes:
CPU et Apple Silicon ; également des backends GPU Windows/Linux

vLLM

Utilisation:
Service orienté production, débit plus élevé
Format du modèle:
Safetensors
Plateformes:
Linux et Windows (WSL2) avec un GPU NVIDIA

C'est le même moteur llama.cpp couvert en détail dans l'explicatif llama.cpp de ce site, et le même moteur vLLM couvert dans l'explicatif vLLM — Docker Model Runner est une couche d'empaquetage et de CLI par-dessus ces moteurs, pas une alternative construite depuis zéro à l'un ou l'autre. Docker documente également un support expérimental de Diffusers pour les modèles de génération d'images (Stable Diffusion) sous Linux avec des GPU NVIDIA, ce qui sort du cadre de cet avis centré sur les LLM.

L'API compatible OpenAI

Docker Model Runner expose une API HTTP compatible OpenAI, permettant au code client OpenAI existant de pointer vers un modèle local plutôt que vers un point d'accès cloud, selon le billet de blog de Docker sur la fonctionnalité.

  • Depuis la machine hôte : http://localhost:12434/engines/v1 (l'accès TCP doit être activé une fois avec docker desktop enable model-runner --tcp 12434)
  • Depuis un autre conteneur sur le même réseau Docker : http://model-runner.docker.internal/engines/v1
  • Compatible avec les outils et frameworks déjà conçus pour le format de l'API OpenAI, notamment LangChain, Spring AI et Open WebUI, selon les propres exemples d'intégration de Docker
  • Les modèles se chargent à la demande dès qu'une requête arrive et restent en mémoire jusqu'à ce qu'un autre modèle soit demandé ou qu'un délai d'inactivité soit dépassé

Plateformes prises en charge

La prise en charge matérielle de Docker Model Runner diffère selon le système d'exploitation et le moteur d'inférence utilisé, selon la documentation de Docker.

macOS

Détails:
Apple Silicon, via llama.cpp avec accélération GPU native

Windows

Détails:
AMD64 avec GPU NVIDIA (pilote 576.57 ou plus récent) via llama.cpp ou vLLM (WSL2) ; ARM64 avec des GPU Qualcomm Adreno série 6xx via llama.cpp

Linux

Détails:
CPU seul, backends NVIDIA CUDA, AMD ROCm ou Vulkan via llama.cpp ; GPU NVIDIA via vLLM (pilote 575.57.08 ou plus récent)

Les versions minimales exactes de pilotes et les familles de GPU prises en charge évoluent au fil des mises à jour de la fonctionnalité par Docker — vérifiez les exigences actuelles sur docs.docker.com/ai/model-runner avant de planifier un déploiement autour d'un GPU spécifique.

Tarifs Docker Model Runner

Docker Model Runner en lui-même n'ajoute aucun coût séparé — c'est une fonctionnalité incluse dans Docker Desktop et Docker Engine. Le fait de devoir payer ou non dépend entièrement de si votre usage de Docker Desktop est admissible à la gratuité, selon le propre Contrat de service d'abonnement de Docker.

Personal (gratuite)

Pour qui:
Particuliers, éducation, projets open source non commerciaux, et entreprises de moins de 250 employés et moins de 10 M$ de chiffre d'affaires annuel
Docker Model Runner inclus ?:
Oui

Pro / Team / Business (payantes)

Pour qui:
Entreprises plus grandes, ou toute organisation ayant besoin de fonctionnalités d'équipe au-delà de la formule gratuite
Docker Model Runner inclus ?:
Oui

Les modèles IA proposés par Docker Hub peuvent être récupérés gratuitement quel que soit le niveau d'abonnement. Les formules Docker payantes (Pro, Team, Business) ajoutent des fonctionnalités sans lien avec Model Runner lui-même, comme des sièges d'équipe et une gestion centralisée — consultez docker.com/pricing pour les tarifs actuels, car ils évoluent indépendamment de la fonctionnalité Model Runner.

Pour qui Docker Model Runner est-il fait ?

Docker Model Runner correspond à un flux de travail précis : les développeurs qui vivent déjà dans Docker et veulent ajouter de l'inférence LLM locale sans ajouter un second outil à leur stack.

Concurrents et alternatives

Docker Model Runner se situe dans le segment des runtimes d'inférence locale, aux côtés de moteurs CLI-first et d'applications de bureau qui enveloppent les mêmes moteurs sous-jacents. Voir le Répertoire des logiciels d'IA locale pour le catalogue complet.

  • llama.cpp — le moteur d'inférence que Docker Model Runner utilise lui-même pour CPU/Apple Silicon ; l'exécuter directement vous donne un contrôle sur les options de compilation et la quantification que le wrapper de Docker n'expose pas.
  • vLLM — le même moteur de service GPU que Docker Model Runner utilise pour les charges de travail de production ; l'exécuter directement convient mieux si vous avez besoin de toute la surface de configuration de vLLM plutôt que de la CLI simplifiée de Docker par-dessus.
  • Ollama — la comparaison en une commande la plus proche : comme Docker Model Runner, Ollama encapsule llama.cpp derrière une CLI simple de récupération-et-exécution et une API compatible OpenAI, mais en tant qu'outil autonome plutôt que fonctionnalité de Docker Desktop — préférable si vous n'utilisez pas déjà Docker.
  • Jan — une application de bureau gratuite et open source avec une fenêtre de chat graphique, construite sur le même moteur llama.cpp, pour les développeurs qui veulent une interface point-and-click plutôt qu'un flux CLI-et-API.
  • GPT4All — une autre application de chat locale open source basée sur llama.cpp, pour le même cas d'usage « je veux une fenêtre, pas un terminal » que Jan.

Erreurs fréquentes

La plupart des confusions autour de Docker Model Runner viennent de l'hypothèse qu'il se comporte comme une charge de travail Docker ordinaire, ou du fait de manquer qu'il s'agit d'une fonctionnalité de Docker Desktop plutôt que d'un produit séparé à installer.

Questions fréquemment posées

Qu'est-ce que Docker Model Runner ?

Docker Model Runner est une fonctionnalité intégrée à Docker Desktop et Docker Engine qui exécute des grands modèles de langage en local via des commandes CLI docker model, avec llama.cpp ou vLLM comme moteur d'inférence et une API compatible OpenAI.

Docker Model Runner est-il gratuit ?

La fonctionnalité elle-même n'ajoute aucun coût séparé — elle fait partie de Docker Desktop et Docker Engine. La nécessité ou non d'un abonnement Docker payant dépend de la taille de votre organisation : Docker Desktop est gratuit pour les particuliers, les projets open source non commerciaux, et les entreprises de moins de 250 employés avec moins de 10 millions de dollars de chiffre d'affaires annuel, selon le Contrat de service d'abonnement de Docker.

Docker Model Runner exécute-t-il les modèles dans un conteneur ?

Non. Malgré le préfixe de commande docker model, le moteur d'inférence (llama.cpp ou vLLM) s'exécute comme un processus natif de l'hôte en dehors du runtime de conteneurs, selon le billet de blog officiel de Docker présentant la fonctionnalité — cela lui donne un accès direct au matériel GPU plutôt que de passer par l'isolation des conteneurs.

Quelles commandes CLI utilise Docker Model Runner ?

Les commandes principales sont docker model pull <modèle> pour télécharger un modèle, docker model run <modèle> pour exécuter l'inférence en ligne de commande, et docker model list pour voir les modèles déjà récupérés localement.

Quel est le point d'accès de l'API Docker Model Runner ?

Une API compatible OpenAI est exposée sur http://localhost:12434/engines/v1 depuis la machine hôte (après activation de l'accès TCP), ou http://model-runner.docker.internal/engines/v1 depuis un autre conteneur sur le même réseau Docker.

Docker Model Runner utilise-t-il llama.cpp ou vLLM ?

Les deux, selon la situation. llama.cpp gère l'inférence CPU et Apple Silicon pour le développement local ; vLLM gère le service adossé à un GPU NVIDIA sous Linux et Windows WSL2, visant un usage de production à plus haut débit.

Quelles plateformes Docker Model Runner prend-il en charge ?

macOS sur Apple Silicon ; Windows sur AMD64 avec un GPU NVIDIA ou ARM64 avec un GPU Qualcomm Adreno série 6xx ; et Linux avec des backends CPU seul, NVIDIA CUDA, AMD ROCm ou Vulkan. Voir la section Plateformes prises en charge ci-dessus pour les détails.

En quoi Docker Model Runner diffère-t-il d'Ollama ?

Les deux encapsulent llama.cpp derrière une CLI simple de récupération-et-exécution et une API compatible OpenAI. La principale différence est l'empaquetage : Ollama est un outil autonome que vous installez seul, tandis que Docker Model Runner est une fonctionnalité de Docker Desktop/Engine — préférable si vous utilisez déjà Docker quotidiennement, car cela n'ajoute pas un second outil à votre flux de travail.

D'où viennent les modèles de Docker Model Runner ?

Les modèles peuvent être récupérés depuis le catalogue IA de Docker Hub, tout autre registre compatible OCI, ou Hugging Face, selon la page produit de Docker.

Sources

← Retour aux LLM locaux avancés