Conclusiones clave
- Integrado en Docker Desktop (macOS, Windows) y Docker Engine (Linux) — no es una descarga aparte
- El motor de inferencia local es llama.cpp para CPU/Apple Silicon o vLLM para servir con GPU NVIDIA
- Se ejecuta como un proceso nativo del host fuera del runtime de contenedores, para acceso directo a la GPU
- CLI:
docker model pull <modelo>,docker model run <modelo>,docker model list - API compatible con OpenAI en
http://localhost:12434/engines/v1desde el host, ohttp://model-runner.docker.internal/engines/v1desde otro contenedor - Los modelos provienen del catálogo de modelos de IA de Docker Hub, otros registros compatibles con OCI, o Hugging Face
- Sin costo adicional — la función viene con Docker Desktop; que Docker Desktop en sí necesite una suscripción de pago depende del tamaño de la empresa
📍 En una frase
Docker Model Runner es una función integrada en Docker Desktop y Docker Engine que ejecuta LLMs en local mediante comandos CLI docker model, con llama.cpp o vLLM como motor de inferencia que corre como proceso nativo del host, y expone una API compatible con OpenAI.
💬 En términos simples
Si ya usas Docker para ejecutar contenedores, Docker Model Runner te permite obtener y ejecutar un modelo de IA de la misma forma — docker model pull y docker model run — sin instalar una aplicación de chat aparte, y sin que el modelo realmente corra dentro de un contenedor.
📌Nota: Esta reseña es el complemento en profundidad de la entrada de Docker Model Runner en el Directorio de Software de LLM Local — consulta esa página para ver de un vistazo cómo se compara con decenas de otras herramientas de IA local.
¿Qué es Docker Model Runner?
Docker Model Runner es una función de Docker Desktop y Docker Engine para obtener y ejecutar modelos de lenguaje grandes en local, usando la misma CLI docker que los desarrolladores ya usan para contenedores. Según la página oficial del producto de Docker, ofrece inferencia local-first con una API compatible con OpenAI, obteniendo modelos de Docker Hub, otros registros compatibles con OCI, o Hugging Face. No es una aplicación de chat con una ventana gráfica — es una función de CLI más un servidor de inferencia local, pensada para usarse desde una terminal, desde Docker Compose, o desde código que llama a su API.
- Viene incluido en Docker Desktop (macOS, Windows) y como paquete
docker-model-pluginpara Docker Engine en Linux — no es un instalador aparte - Motores de inferencia local: llama.cpp para CPU y Apple Silicon, vLLM para servir con GPU NVIDIA, según la documentación de Docker
- Fuentes de modelos: el catálogo curado de modelos de IA de Docker Hub, cualquier registro compatible con OCI, o Hugging Face
- Se integra con herramientas que los desarrolladores ya usan alrededor de Docker: Docker Compose, Testcontainers, y frameworks como LangChain, Spring AI y Open WebUI vía la API compatible con OpenAI
- Desarrollador: Docker, Inc.
Instalación y primeros pasos
Docker Model Runner es una función de CLI integrada en Docker Desktop y Docker Engine, no una aplicación independiente para descargar, así que no hay un instalador aparte ni un botón de descarga — instalas Docker Desktop (o, en Linux, Docker Engine más el plugin de model-runner) y los comandos docker model quedan disponibles.
- 1Instala Docker Desktop para macOS o Windows, o instala en Linux Docker Engine más el plugin de model-runner (
sudo apt-get install docker-model-pluginen Debian/Ubuntu, osudo dnf install docker-model-pluginen Fedora/RHEL). - 2Activa Model Runner si aún no lo está:
docker desktop enable model-runner(Docker Desktop), o asegúrate de que el plugin esté activo en Docker Engine. - 3Obtén un modelo del catálogo de IA de Docker Hub:
docker model pull ai/smollm2:360M-Q4_K_M. - 4Ejecútalo directamente desde la línea de comandos:
docker model run ai/smollm2:360M-Q4_K_M "Give me a fact about whales." - 5Lista en cualquier momento los modelos ya obtenidos en local con
docker model list. - 6Para acceder al modelo por HTTP en lugar de por CLI, usa la API compatible con OpenAI — ver La API compatible con OpenAI más abajo para el endpoint exacto.
Por qué corre como proceso del host, no en un contenedor
A pesar del prefijo de comando docker, Docker Model Runner no ejecuta la inferencia del modelo dentro de un contenedor. La entrada de blog oficial de Docker que presenta la función es explícita al respecto: ejecutar docker model run "no levanta ningún tipo de contenedor". En su lugar, llama a una API de servidor de inferencia alojada por Model Runner a través de Docker Desktop, y ese servidor de inferencia ejecuta su motor (llama.cpp o vLLM) como un proceso nativo del host — un proceso normal que corre directamente en tu sistema operativo, igual que cualquier otro programa instalado localmente.
- La razón indicada es el acceso a la GPU: un proceso nativo del host puede usar la GPU de tu máquina (la GPU integrada de Apple Silicon, o una GPU NVIDIA) directamente, sin la indirección extra de pasar la GPU de contenedor a host
- Es una decisión de arquitectura deliberada por rendimiento, no una limitación del runtime de contenedores de Docker — Docker Model Runner sí usa contenedores en otras partes de su flujo de trabajo (por ejemplo, parte del empaquetado de modelos se basa en OCI), pero no para el proceso de inferencia en sí
- En la práctica, esto significa que un modelo en ejecución se comporta más como un servicio en segundo plano en tu máquina que como un contenedor que podrías inspeccionar con
docker ps - Los modelos permanecen cargados en memoria hasta que se solicita otro modelo o pasa un periodo de inactividad, así que la primera solicitud tras el arranque es más lenta que las siguientes
llama.cpp vs. vLLM: qué motor ejecuta tu modelo
Docker Model Runner no implementa su propio motor de inferencia — envuelve dos motores open source existentes y elige entre ellos según tu hardware y el formato del modelo, según la documentación de Docker.
llama.cpp
- Uso:
- Desarrollo local, inferencia eficiente en recursos
- Formato del modelo:
- GGUF (cuantizado)
- Plataformas:
- CPU y Apple Silicon; también backends de GPU en Windows/Linux
vLLM
- Uso:
- Servicio orientado a producción, mayor rendimiento
- Formato del modelo:
- Safetensors
- Plataformas:
- Linux y Windows (WSL2) con GPU NVIDIA
Es el mismo motor llama.cpp cubierto en profundidad en el explicativo de llama.cpp de este sitio, y el mismo motor vLLM cubierto en el explicativo de vLLM — Docker Model Runner es una capa de empaquetado y CLI sobre estos motores, no una alternativa construida desde cero a ninguno de los dos. Docker también documenta soporte experimental de Diffusers para modelos de generación de imágenes (Stable Diffusion) en Linux con GPUs NVIDIA, algo fuera del alcance de esta reseña centrada en LLMs.
La API compatible con OpenAI
Docker Model Runner expone una API HTTP compatible con OpenAI para que el código cliente de OpenAI existente pueda apuntar a un modelo local en lugar de a un endpoint en la nube, según la entrada de blog de Docker sobre la función.
- Desde la máquina host:
http://localhost:12434/engines/v1(el acceso TCP debe activarse una vez condocker desktop enable model-runner --tcp 12434) - Desde otro contenedor en la misma red de Docker:
http://model-runner.docker.internal/engines/v1 - Compatible con herramientas y frameworks ya construidos para el formato de la API de OpenAI, incluyendo LangChain, Spring AI y Open WebUI, según los propios ejemplos de integración de Docker
- Los modelos se cargan bajo demanda cuando llega una solicitud y permanecen en memoria hasta que se solicita otro modelo o pasa un tiempo de inactividad
Plataformas compatibles
El soporte de hardware de Docker Model Runner difiere según el sistema operativo y el motor de inferencia en uso, según la documentación de Docker.
macOS
- Detalles:
- Apple Silicon, vía llama.cpp con aceleración GPU nativa
Windows
- Detalles:
- AMD64 con GPU NVIDIA (driver 576.57 o más reciente) vía llama.cpp o vLLM (WSL2); ARM64 con GPUs Qualcomm Adreno serie 6xx vía llama.cpp
Linux
- Detalles:
- Solo CPU, backends NVIDIA CUDA, AMD ROCm o Vulkan vía llama.cpp; GPU NVIDIA vía vLLM (driver 575.57.08 o más reciente)
Las versiones mínimas exactas de driver y las familias de GPU compatibles cambian a medida que Docker actualiza la función — verifica los requisitos actuales en docs.docker.com/ai/model-runner antes de planificar un despliegue en torno a una GPU específica.
Precios de Docker Model Runner
Docker Model Runner en sí no añade ningún costo aparte — es una función incluida en Docker Desktop y Docker Engine. Que debas pagar algo depende por completo de si tu uso de Docker Desktop califica como gratuito, según el propio Acuerdo de Servicio de Suscripción de Docker.
Personal (gratis)
- Para quién es:
- Individuos, educación, proyectos open source no comerciales, y empresas con menos de 250 empleados y menos de $10M en ingresos anuales
- ¿Incluye Docker Model Runner?:
- Sí
Pro / Team / Business (de pago)
- Para quién es:
- Empresas más grandes, o cualquiera que necesite funciones de equipo más allá del alcance del plan gratuito
- ¿Incluye Docker Model Runner?:
- Sí
Los modelos de IA curados de Docker Hub se pueden obtener gratis sin importar el nivel de suscripción. Los planes de pago de Docker (Pro, Team, Business) añaden funciones sin relación con Model Runner en sí, como asientos de equipo y gestión centralizada — consulta docker.com/pricing para los precios actuales, ya que cambian de forma independiente a la función Model Runner.
¿Quién debería usar Docker Model Runner?
Docker Model Runner encaja con un flujo de trabajo específico: desarrolladores que ya viven en Docker y quieren añadir inferencia de LLM local sin sumar una segunda herramienta a su stack.
Competidores y alternativas
Docker Model Runner se ubica en el segmento de runtimes de inferencia local, junto a motores CLI-first y aplicaciones de escritorio que envuelven los mismos motores subyacentes. Ver el Directorio de Software de LLM Local para el catálogo completo.
- llama.cpp — el motor de inferencia que el propio Docker Model Runner usa para CPU/Apple Silicon; usarlo directamente te da control sobre flags de compilación y cuantización que el wrapper de Docker no expone.
- vLLM — el mismo motor de servicio en GPU que Docker Model Runner usa para cargas de trabajo de producción; usarlo directamente conviene más si necesitas toda la superficie de configuración de vLLM en lugar de la CLI simplificada de Docker sobre él.
- Ollama — la comparación de "un solo comando" más cercana: como Docker Model Runner, Ollama envuelve llama.cpp detrás de una CLI simple de pull-and-run y una API compatible con OpenAI, pero como herramienta independiente en lugar de función de Docker Desktop — mejor opción si aún no usas Docker.
- Jan — una aplicación de escritorio gratuita y open source con una ventana de chat gráfica, construida sobre el mismo motor llama.cpp, para desarrolladores que quieren una interfaz apuntar-y-hacer-clic en lugar de un flujo de CLI y API.
- GPT4All — otra aplicación de chat local open source basada en llama.cpp, para el mismo caso de uso de "quiero una ventana, no una terminal" que Jan.
Errores comunes
La mayor parte de la confusión sobre Docker Model Runner viene de asumir que se comporta como una carga de trabajo Docker ordinaria, o de pasar por alto que es una función de Docker Desktop y no un producto separado para instalar.
Preguntas frecuentes
¿Qué es Docker Model Runner?
Docker Model Runner es una función integrada en Docker Desktop y Docker Engine que ejecuta modelos de lenguaje grandes en local mediante comandos CLI docker model, usando llama.cpp o vLLM como motor de inferencia y exponiendo una API compatible con OpenAI.
¿Es gratis Docker Model Runner?
La función en sí no añade ningún costo aparte — es parte de Docker Desktop y Docker Engine. Que necesites una suscripción de pago de Docker depende del tamaño de tu organización: Docker Desktop es gratuito para individuos, proyectos open source no comerciales, y empresas con menos de 250 empleados y menos de 10 millones de dólares en ingresos anuales, según el Acuerdo de Servicio de Suscripción de Docker.
¿Docker Model Runner ejecuta los modelos dentro de un contenedor?
No. A pesar del prefijo de comando docker model, el motor de inferencia (llama.cpp o vLLM) corre como un proceso nativo del host fuera del runtime de contenedores, según la propia entrada de blog de Docker que presenta la función — esto le da acceso directo al hardware de GPU en lugar de pasar por el aislamiento de contenedores.
¿Qué comandos de CLI usa Docker Model Runner?
Los comandos principales son docker model pull <modelo> para descargar un modelo, docker model run <modelo> para ejecutar inferencia desde la línea de comandos, y docker model list para ver los modelos ya obtenidos en local.
¿Cuál es el endpoint de la API de Docker Model Runner?
Se expone una API compatible con OpenAI en http://localhost:12434/engines/v1 desde la máquina host (tras activar el acceso TCP), o en http://model-runner.docker.internal/engines/v1 desde otro contenedor en la misma red de Docker.
¿Docker Model Runner usa llama.cpp o vLLM?
Ambos, según la situación. llama.cpp maneja la inferencia en CPU y Apple Silicon para desarrollo local; vLLM maneja el servicio con GPU NVIDIA en Linux y Windows WSL2, orientado a un uso de producción con mayor rendimiento.
¿Qué plataformas soporta Docker Model Runner?
macOS en Apple Silicon; Windows en AMD64 con GPU NVIDIA o ARM64 con una GPU Qualcomm Adreno serie 6xx; y Linux con backends de solo CPU, NVIDIA CUDA, AMD ROCm o Vulkan. Ver la sección Plataformas compatibles más arriba para más detalles.
¿En qué se diferencia Docker Model Runner de Ollama?
Ambos envuelven llama.cpp detrás de una CLI simple de pull-and-run y una API compatible con OpenAI. La diferencia principal está en el empaquetado: Ollama es una herramienta independiente que instalas por separado, mientras que Docker Model Runner es una función de Docker Desktop/Engine — mejor opción si ya usas Docker a diario, ya que no añade una segunda herramienta a tu flujo de trabajo.
¿De dónde vienen los modelos de Docker Model Runner?
Los modelos se pueden obtener del catálogo curado de modelos de IA de Docker Hub, de cualquier otro registro compatible con OCI, o de Hugging Face, según la página del producto de Docker.
