Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Docker Model Runner Reseña 2026: LLMs locales con la CLI de Docker
Overview & Reference

Docker Model Runner Reseña 2026: LLMs locales con la CLI de Docker

·11 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Docker Model Runner es una función de Docker Desktop y Docker Engine, no una aplicación separada para descargar, que permite obtener y ejecutar modelos de lenguaje grandes con comandos CLI docker model. La inferencia local corre mediante llama.cpp (CPU y Apple Silicon) o vLLM (GPU NVIDIA, para servir con mayor rendimiento) — y, el detalle que la mayoría de las reseñas pasa por alto, ese motor de inferencia se ejecuta como un proceso nativo del host, no dentro de un contenedor, por lo que puede acceder directamente al hardware de la GPU en lugar de pasar por el aislamiento de contenedores. Docker Model Runner expone una API compatible con OpenAI y viene incluido gratis en Docker Desktop; que Docker Desktop en sí sea gratuito depende del tamaño de tu organización (ver Precios más abajo).

Docker Model Runner es una función integrada en Docker Desktop y Docker Engine que ejecuta modelos de lenguaje grandes en local mediante comandos CLI docker model, apoyada en llama.cpp o vLLM, y expuesta a través de una API compatible con OpenAI. No es una aplicación independiente: es una capacidad añadida a Docker Desktop, así que viene gratis con el mismo Docker Desktop que la mayoría de los desarrolladores ya tienen instalado. Esta reseña cubre qué hace realmente Docker Model Runner, cómo ejecuta modelos sin poner la inferencia dentro de un contenedor, cómo instalarlo y usarlo, y cómo se posiciona frente a otras herramientas de runtime local como Ollama y llama.cpp.

Docker Model Runner Reseña 2026: LLMs locales con la CLI de Docker

Conclusiones clave

  • Integrado en Docker Desktop (macOS, Windows) y Docker Engine (Linux) — no es una descarga aparte
  • El motor de inferencia local es llama.cpp para CPU/Apple Silicon o vLLM para servir con GPU NVIDIA
  • Se ejecuta como un proceso nativo del host fuera del runtime de contenedores, para acceso directo a la GPU
  • CLI: docker model pull <modelo>, docker model run <modelo>, docker model list
  • API compatible con OpenAI en http://localhost:12434/engines/v1 desde el host, o http://model-runner.docker.internal/engines/v1 desde otro contenedor
  • Los modelos provienen del catálogo de modelos de IA de Docker Hub, otros registros compatibles con OCI, o Hugging Face
  • Sin costo adicional — la función viene con Docker Desktop; que Docker Desktop en sí necesite una suscripción de pago depende del tamaño de la empresa

📍 En una frase

Docker Model Runner es una función integrada en Docker Desktop y Docker Engine que ejecuta LLMs en local mediante comandos CLI docker model, con llama.cpp o vLLM como motor de inferencia que corre como proceso nativo del host, y expone una API compatible con OpenAI.

💬 En términos simples

Si ya usas Docker para ejecutar contenedores, Docker Model Runner te permite obtener y ejecutar un modelo de IA de la misma forma — docker model pull y docker model run — sin instalar una aplicación de chat aparte, y sin que el modelo realmente corra dentro de un contenedor.

📌Nota: Esta reseña es el complemento en profundidad de la entrada de Docker Model Runner en el Directorio de Software de LLM Local — consulta esa página para ver de un vistazo cómo se compara con decenas de otras herramientas de IA local.

¿Qué es Docker Model Runner?

Docker Model Runner es una función de Docker Desktop y Docker Engine para obtener y ejecutar modelos de lenguaje grandes en local, usando la misma CLI docker que los desarrolladores ya usan para contenedores. Según la página oficial del producto de Docker, ofrece inferencia local-first con una API compatible con OpenAI, obteniendo modelos de Docker Hub, otros registros compatibles con OCI, o Hugging Face. No es una aplicación de chat con una ventana gráfica — es una función de CLI más un servidor de inferencia local, pensada para usarse desde una terminal, desde Docker Compose, o desde código que llama a su API.

  • Viene incluido en Docker Desktop (macOS, Windows) y como paquete docker-model-plugin para Docker Engine en Linux — no es un instalador aparte
  • Motores de inferencia local: llama.cpp para CPU y Apple Silicon, vLLM para servir con GPU NVIDIA, según la documentación de Docker
  • Fuentes de modelos: el catálogo curado de modelos de IA de Docker Hub, cualquier registro compatible con OCI, o Hugging Face
  • Se integra con herramientas que los desarrolladores ya usan alrededor de Docker: Docker Compose, Testcontainers, y frameworks como LangChain, Spring AI y Open WebUI vía la API compatible con OpenAI
  • Desarrollador: Docker, Inc.

Instalación y primeros pasos

Docker Model Runner es una función de CLI integrada en Docker Desktop y Docker Engine, no una aplicación independiente para descargar, así que no hay un instalador aparte ni un botón de descarga — instalas Docker Desktop (o, en Linux, Docker Engine más el plugin de model-runner) y los comandos docker model quedan disponibles.

  1. 1
    Instala Docker Desktop para macOS o Windows, o instala en Linux Docker Engine más el plugin de model-runner (sudo apt-get install docker-model-plugin en Debian/Ubuntu, o sudo dnf install docker-model-plugin en Fedora/RHEL).
  2. 2
    Activa Model Runner si aún no lo está: docker desktop enable model-runner (Docker Desktop), o asegúrate de que el plugin esté activo en Docker Engine.
  3. 3
    Obtén un modelo del catálogo de IA de Docker Hub: docker model pull ai/smollm2:360M-Q4_K_M.
  4. 4
    Ejecútalo directamente desde la línea de comandos: docker model run ai/smollm2:360M-Q4_K_M "Give me a fact about whales."
  5. 5
    Lista en cualquier momento los modelos ya obtenidos en local con docker model list.
  6. 6
    Para acceder al modelo por HTTP en lugar de por CLI, usa la API compatible con OpenAI — ver La API compatible con OpenAI más abajo para el endpoint exacto.

Por qué corre como proceso del host, no en un contenedor

A pesar del prefijo de comando docker, Docker Model Runner no ejecuta la inferencia del modelo dentro de un contenedor. La entrada de blog oficial de Docker que presenta la función es explícita al respecto: ejecutar docker model run "no levanta ningún tipo de contenedor". En su lugar, llama a una API de servidor de inferencia alojada por Model Runner a través de Docker Desktop, y ese servidor de inferencia ejecuta su motor (llama.cpp o vLLM) como un proceso nativo del host — un proceso normal que corre directamente en tu sistema operativo, igual que cualquier otro programa instalado localmente.

  • La razón indicada es el acceso a la GPU: un proceso nativo del host puede usar la GPU de tu máquina (la GPU integrada de Apple Silicon, o una GPU NVIDIA) directamente, sin la indirección extra de pasar la GPU de contenedor a host
  • Es una decisión de arquitectura deliberada por rendimiento, no una limitación del runtime de contenedores de Docker — Docker Model Runner sí usa contenedores en otras partes de su flujo de trabajo (por ejemplo, parte del empaquetado de modelos se basa en OCI), pero no para el proceso de inferencia en sí
  • En la práctica, esto significa que un modelo en ejecución se comporta más como un servicio en segundo plano en tu máquina que como un contenedor que podrías inspeccionar con docker ps
  • Los modelos permanecen cargados en memoria hasta que se solicita otro modelo o pasa un periodo de inactividad, así que la primera solicitud tras el arranque es más lenta que las siguientes

llama.cpp vs. vLLM: qué motor ejecuta tu modelo

Docker Model Runner no implementa su propio motor de inferencia — envuelve dos motores open source existentes y elige entre ellos según tu hardware y el formato del modelo, según la documentación de Docker.

llama.cpp

Uso:
Desarrollo local, inferencia eficiente en recursos
Formato del modelo:
GGUF (cuantizado)
Plataformas:
CPU y Apple Silicon; también backends de GPU en Windows/Linux

vLLM

Uso:
Servicio orientado a producción, mayor rendimiento
Formato del modelo:
Safetensors
Plataformas:
Linux y Windows (WSL2) con GPU NVIDIA

Es el mismo motor llama.cpp cubierto en profundidad en el explicativo de llama.cpp de este sitio, y el mismo motor vLLM cubierto en el explicativo de vLLM — Docker Model Runner es una capa de empaquetado y CLI sobre estos motores, no una alternativa construida desde cero a ninguno de los dos. Docker también documenta soporte experimental de Diffusers para modelos de generación de imágenes (Stable Diffusion) en Linux con GPUs NVIDIA, algo fuera del alcance de esta reseña centrada en LLMs.

La API compatible con OpenAI

Docker Model Runner expone una API HTTP compatible con OpenAI para que el código cliente de OpenAI existente pueda apuntar a un modelo local en lugar de a un endpoint en la nube, según la entrada de blog de Docker sobre la función.

  • Desde la máquina host: http://localhost:12434/engines/v1 (el acceso TCP debe activarse una vez con docker desktop enable model-runner --tcp 12434)
  • Desde otro contenedor en la misma red de Docker: http://model-runner.docker.internal/engines/v1
  • Compatible con herramientas y frameworks ya construidos para el formato de la API de OpenAI, incluyendo LangChain, Spring AI y Open WebUI, según los propios ejemplos de integración de Docker
  • Los modelos se cargan bajo demanda cuando llega una solicitud y permanecen en memoria hasta que se solicita otro modelo o pasa un tiempo de inactividad

Plataformas compatibles

El soporte de hardware de Docker Model Runner difiere según el sistema operativo y el motor de inferencia en uso, según la documentación de Docker.

macOS

Detalles:
Apple Silicon, vía llama.cpp con aceleración GPU nativa

Windows

Detalles:
AMD64 con GPU NVIDIA (driver 576.57 o más reciente) vía llama.cpp o vLLM (WSL2); ARM64 con GPUs Qualcomm Adreno serie 6xx vía llama.cpp

Linux

Detalles:
Solo CPU, backends NVIDIA CUDA, AMD ROCm o Vulkan vía llama.cpp; GPU NVIDIA vía vLLM (driver 575.57.08 o más reciente)

Las versiones mínimas exactas de driver y las familias de GPU compatibles cambian a medida que Docker actualiza la función — verifica los requisitos actuales en docs.docker.com/ai/model-runner antes de planificar un despliegue en torno a una GPU específica.

Precios de Docker Model Runner

Docker Model Runner en sí no añade ningún costo aparte — es una función incluida en Docker Desktop y Docker Engine. Que debas pagar algo depende por completo de si tu uso de Docker Desktop califica como gratuito, según el propio Acuerdo de Servicio de Suscripción de Docker.

Personal (gratis)

Para quién es:
Individuos, educación, proyectos open source no comerciales, y empresas con menos de 250 empleados y menos de $10M en ingresos anuales
¿Incluye Docker Model Runner?:

Pro / Team / Business (de pago)

Para quién es:
Empresas más grandes, o cualquiera que necesite funciones de equipo más allá del alcance del plan gratuito
¿Incluye Docker Model Runner?:

Los modelos de IA curados de Docker Hub se pueden obtener gratis sin importar el nivel de suscripción. Los planes de pago de Docker (Pro, Team, Business) añaden funciones sin relación con Model Runner en sí, como asientos de equipo y gestión centralizada — consulta docker.com/pricing para los precios actuales, ya que cambian de forma independiente a la función Model Runner.

¿Quién debería usar Docker Model Runner?

Docker Model Runner encaja con un flujo de trabajo específico: desarrolladores que ya viven en Docker y quieren añadir inferencia de LLM local sin sumar una segunda herramienta a su stack.

Competidores y alternativas

Docker Model Runner se ubica en el segmento de runtimes de inferencia local, junto a motores CLI-first y aplicaciones de escritorio que envuelven los mismos motores subyacentes. Ver el Directorio de Software de LLM Local para el catálogo completo.

  • llama.cpp — el motor de inferencia que el propio Docker Model Runner usa para CPU/Apple Silicon; usarlo directamente te da control sobre flags de compilación y cuantización que el wrapper de Docker no expone.
  • vLLM — el mismo motor de servicio en GPU que Docker Model Runner usa para cargas de trabajo de producción; usarlo directamente conviene más si necesitas toda la superficie de configuración de vLLM en lugar de la CLI simplificada de Docker sobre él.
  • Ollama — la comparación de "un solo comando" más cercana: como Docker Model Runner, Ollama envuelve llama.cpp detrás de una CLI simple de pull-and-run y una API compatible con OpenAI, pero como herramienta independiente en lugar de función de Docker Desktop — mejor opción si aún no usas Docker.
  • Jan — una aplicación de escritorio gratuita y open source con una ventana de chat gráfica, construida sobre el mismo motor llama.cpp, para desarrolladores que quieren una interfaz apuntar-y-hacer-clic en lugar de un flujo de CLI y API.
  • GPT4All — otra aplicación de chat local open source basada en llama.cpp, para el mismo caso de uso de "quiero una ventana, no una terminal" que Jan.

Errores comunes

La mayor parte de la confusión sobre Docker Model Runner viene de asumir que se comporta como una carga de trabajo Docker ordinaria, o de pasar por alto que es una función de Docker Desktop y no un producto separado para instalar.

Preguntas frecuentes

¿Qué es Docker Model Runner?

Docker Model Runner es una función integrada en Docker Desktop y Docker Engine que ejecuta modelos de lenguaje grandes en local mediante comandos CLI docker model, usando llama.cpp o vLLM como motor de inferencia y exponiendo una API compatible con OpenAI.

¿Es gratis Docker Model Runner?

La función en sí no añade ningún costo aparte — es parte de Docker Desktop y Docker Engine. Que necesites una suscripción de pago de Docker depende del tamaño de tu organización: Docker Desktop es gratuito para individuos, proyectos open source no comerciales, y empresas con menos de 250 empleados y menos de 10 millones de dólares en ingresos anuales, según el Acuerdo de Servicio de Suscripción de Docker.

¿Docker Model Runner ejecuta los modelos dentro de un contenedor?

No. A pesar del prefijo de comando docker model, el motor de inferencia (llama.cpp o vLLM) corre como un proceso nativo del host fuera del runtime de contenedores, según la propia entrada de blog de Docker que presenta la función — esto le da acceso directo al hardware de GPU en lugar de pasar por el aislamiento de contenedores.

¿Qué comandos de CLI usa Docker Model Runner?

Los comandos principales son docker model pull <modelo> para descargar un modelo, docker model run <modelo> para ejecutar inferencia desde la línea de comandos, y docker model list para ver los modelos ya obtenidos en local.

¿Cuál es el endpoint de la API de Docker Model Runner?

Se expone una API compatible con OpenAI en http://localhost:12434/engines/v1 desde la máquina host (tras activar el acceso TCP), o en http://model-runner.docker.internal/engines/v1 desde otro contenedor en la misma red de Docker.

¿Docker Model Runner usa llama.cpp o vLLM?

Ambos, según la situación. llama.cpp maneja la inferencia en CPU y Apple Silicon para desarrollo local; vLLM maneja el servicio con GPU NVIDIA en Linux y Windows WSL2, orientado a un uso de producción con mayor rendimiento.

¿Qué plataformas soporta Docker Model Runner?

macOS en Apple Silicon; Windows en AMD64 con GPU NVIDIA o ARM64 con una GPU Qualcomm Adreno serie 6xx; y Linux con backends de solo CPU, NVIDIA CUDA, AMD ROCm o Vulkan. Ver la sección Plataformas compatibles más arriba para más detalles.

¿En qué se diferencia Docker Model Runner de Ollama?

Ambos envuelven llama.cpp detrás de una CLI simple de pull-and-run y una API compatible con OpenAI. La diferencia principal está en el empaquetado: Ollama es una herramienta independiente que instalas por separado, mientras que Docker Model Runner es una función de Docker Desktop/Engine — mejor opción si ya usas Docker a diario, ya que no añade una segunda herramienta a tu flujo de trabajo.

¿De dónde vienen los modelos de Docker Model Runner?

Los modelos se pueden obtener del catálogo curado de modelos de IA de Docker Hub, de cualquier otro registro compatible con OCI, o de Hugging Face, según la página del producto de Docker.

Fuentes

← Volver a LLM locales avanzados