Conclusiones clave
- NVIDIA Dynamo (github.com/ai-dynamo/dynamo) es un framework gratuito, de código abierto, de servicio de inferencia distribuida a escala de centro de datos
- Licencia: el archivo LICENSE del repositorio indica Apache-2.0; el propio campo de metadatos de la API de GitHub reporta por separado NOASSERTION para el mismo repositorio — verificado directamente contra el archivo LICENSE
- Orquesta motores de inferencia ya existentes —vLLM, TensorRT-LLM y SGLang— en lugar de reemplazarlos
- Técnicas principales: servicio de prefill/decode desagregado, enrutamiento consciente de la caché KV, un KV Block Manager para descargar la caché a CPU/SSD/almacenamiento remoto, y un autoescalador orientado a SLA llamado Planner
- Explícitamente construido para despliegues multi-GPU y multi-nodo en centros de datos o clústeres en la nube — la propia documentación de NVIDIA indica que los casos de uso de una sola GPU y un solo modelo no lo necesitan
- Más de 8.100 estrellas en GitHub, más de 1.590 forks y un gran número de issues abiertos (más de 1.500) al momento de esta reseña
📍 En una frase
NVIDIA Dynamo es un framework gratuito, de código abierto, de servicio de inferencia distribuida a escala de centro de datos con más de 8.100 estrellas en GitHub que orquesta vLLM, TensorRT-LLM y SGLang en varias GPU y nodos mediante servicio de prefill/decode desagregado y enrutamiento consciente de la caché KV.
💬 En términos simples
NVIDIA Dynamo no es un ejecutor de modelos que instalas en una laptop — es una capa de coordinación que los equipos grandes colocan frente a un motor de inferencia (como vLLM) cuando ejecutan modelos en muchas GPU o muchos servidores a la vez, de modo que las solicitudes se enruten de forma eficiente y el clúster escale automáticamente para cumplir objetivos de latencia.
📌Nota: Esta reseña se basa en el propio repositorio de GitHub de Dynamo de NVIDIA y su documentación. Las cifras de rendimiento, como los multiplicadores de throughput específicos, son los propios benchmarks publicados por NVIDIA, no cifras que PromptQuorum haya reproducido de forma independiente — trátalas como reportadas por el proveedor hasta que se verifiquen en tu propio hardware y carga de trabajo.
¿Qué es NVIDIA Dynamo?
NVIDIA Dynamo es un framework gratuito y de código abierto que coordina cómo se sirven los modelos de lenguaje de gran tamaño en varias GPU y nodos dentro de un centro de datos o clúster en la nube, en lugar de ejecutar la inferencia por sí mismo. NVIDIA lo describe como la capa de orquestación por encima de los motores de inferencia, que transforma un clúster de GPU en un único sistema de inferencia coordinado.
- Tipo de producto: un framework de orquestación de inferencia distribuida — no un motor de inferencia independiente, un ejecutor de modelos ni una app de escritorio
- Mantenedor: NVIDIA, desarrollado como un proyecto de código abierto bajo la organización de GitHub ai-dynamo
- Licencia: el archivo LICENSE del repositorio es Apache-2.0; ten en cuenta que los metadatos automáticos de detección de licencia de GitHub para el mismo repositorio muestran por separado NOASSERTION — esta reseña considera el propio archivo LICENSE como la fuente autorizada
- Repositorio creado en marzo de 2025, según los metadatos de GitHub
- Escala: más de 8.100 estrellas en GitHub y más de 1.590 forks al momento de esta reseña, con un número de issues abiertos inusualmente alto (más de 1.500) para un proyecto de este tamaño — típico de un proyecto de infraestructura de rápido movimiento y alta contribución, pero algo a tener en cuenta en cualquier evaluación de preparación para producción
¿Cuál es el historial de versiones de NVIDIA Dynamo?
NVIDIA Dynamo publica etiquetas de versión específicas por modelo y por plataforma a un ritmo rápido, con etiquetas de desarrollo activas en el rango v1.4–v1.6 al momento de esta reseña.
- Los lanzamientos etiquetados recientes incluyen compilaciones específicas por modelo y por plataforma (por ejemplo, versiones vinculadas a familias de modelos específicas como DeepSeek, Kimi o Solar), lo que refleja lo de cerca que el proyecto sigue los nuevos lanzamientos de modelos de peso abierto
- El proyecto alcanzó hitos de preparación para producción general que NVIDIA describe como incluyendo despliegue sin configuración, soporte de inferencia agéntica, manejo multimodal de codificación/prefill/decode y soporte nativo de generación de video
- Los propios resultados publicados por NVIDIA para versiones posteriores citan mejoras sustanciales de throughput en combinaciones específicas de modelo/hardware (por ejemplo, DeepSeek R1 y sistemas NVIDIA GB300 NVL72) — se trata de benchmarks reportados por el proveedor, no de cifras que PromptQuorum haya verificado de forma independiente
¿Qué hace realmente NVIDIA Dynamo?
NVIDIA Dynamo se sitúa frente a uno o varios motores de inferencia y decide cómo enrutar, agrupar (batch) y escalar solicitudes en un clúster de GPU para cumplir objetivos de latencia y costo.
- Servicio desagregado: divide las fases de prefill y decode de la inferencia en pools de GPU escalables de forma independiente, de modo que cada fase pueda usar hardware dimensionado para su propia carga de trabajo
- Enrutamiento consciente de la caché KV: enruta solicitudes según la carga de cada worker y el solapamiento existente de la caché de clave-valor para evitar cómputo redundante, lo que la documentación de NVIDIA describe como una reducción aproximada a la mitad del tiempo hasta el primer token en configuraciones compatibles
- KV Block Manager (KVBM): descarga las cachés de clave-valor entre GPU, CPU, SSD y almacenamiento remoto para extender la longitud efectiva de contexto más allá de la memoria de una sola GPU
- Planner: un autoescalador orientado a SLA que perfila cargas de trabajo y redimensiona los pools de GPU para cumplir objetivos de latencia a un menor costo total de propiedad
- ModelExpress: transmite los pesos del modelo de GPU a GPU mediante NIXL/NVLink, lo que la documentación de NVIDIA describe como una reducción sustancial del tiempo de arranque en frío para nuevas réplicas
- Soporte de backends: integración completa con vLLM, TensorRT-LLM y SGLang, con una matriz de funciones documentada que cubre el soporte por backend de adaptadores LoRA, migración de solicitudes y decodificación especulativa
¿Cómo se despliega NVIDIA Dynamo?
NVIDIA Dynamo se despliega típicamente mediante contenedores Docker por backend de inferencia, se instala vía pip para desarrollo, o se implementa en un clúster con Kubernetes y charts de Helm.
- Docker: NVIDIA publica imágenes de contenedor precompiladas por backend (por ejemplo, sglang-runtime, tensorrtllm-runtime, vllm-runtime) a través de su registro de contenedores
- Python/pip: instala con un extra específico de backend, por ejemplo `uv pip install --prerelease=allow "ai-dynamo[sglang]"`, cambiando el extra entre corchetes por el backend elegido
- Compilación desde el código fuente: se admite una compilación completa en Rust y Python desde el código fuente para colaboradores, lo que requiere build-essential y el toolchain de Rust
- Kubernetes: los despliegues de producción suelen usar charts de Helm y los manifiestos YAML sin configuración de NVIDIA, que aplican automáticamente el autoescalado orientado a SLA
uv pip install --prerelease=allow "ai-dynamo[sglang]"Plataforma, precios y licencia
Plataforma
- Lo que indica NVIDIA Dynamo:
- Framework de servicio distribuido basado en Linux y orientado a centros de datos/Kubernetes — sin ruta de instalación para consumidor de una sola máquina.
Costo
- Lo que indica NVIDIA Dynamo:
- Gratuito y de código abierto. Sigues pagando las GPU, la infraestructura de clúster y los costos en la nube que orquesta.
Licencia
- Lo que indica NVIDIA Dynamo:
- El archivo LICENSE del repositorio es Apache-2.0; el campo separado de metadatos de licencia de GitHub muestra NOASSERTION para el mismo repositorio.
Método de instalación
- Lo que indica NVIDIA Dynamo:
- Imágenes Docker por backend,
pip/uv pipcon un extra de backend, Kubernetes/Helm, o una compilación completa desde el código fuente.
Verifica la ruta de instalación recomendada actual y las etiquetas de contenedor en github.com/ai-dynamo/dynamo, ya que las imágenes específicas por backend y los extras de paquete cambian entre versiones.
Instalar NVIDIA Dynamo
NVIDIA Dynamo se instala de forma gratuita vía Docker, pip o Kubernetes/Helm, y su código fuente está en GitHub.
Source | Link |
|---|---|
| Repositorio de GitHub (código fuente) | github.com/ai-dynamo/dynamo |
| Documentación oficial | docs.nvidia.com/dynamo/latest |
| Paquete de PyPI (extras de backend) | ai-dynamo en PyPI, por ejemplo `ai-dynamo[sglang], ai-dynamo[vllm], ai-dynamo[trtllm]` |
| Página de lanzamientos | github.com/ai-dynamo/dynamo/releases |
NVIDIA Dynamo requiere Linux, hardware de GPU y, normalmente, un entorno multi-nodo o Kubernetes para su conjunto completo de funciones — no hay instalador de escritorio.
¿Cuánto cuesta NVIDIA Dynamo?
NVIDIA Dynamo en sí es gratuito — no tiene tarifa de licencia, suscripción ni cargo por uso. Tu costo real es el hardware de GPU, la infraestructura en la nube y la red que orquesta, lo cual suele ser considerable en un despliegue multi-nodo.
- El framework: gratuito, de código abierto (Apache-2.0 según su archivo LICENSE), sin nivel de pago
- Costos de infraestructura: múltiples GPU, a menudo en varios nodos, más interconexiones rápidas (NVLink/NIXL) para obtener todo el beneficio de sus funciones de transmisión de pesos y descarga de caché KV
- No es adecuado para presupuestos de una sola GPU: la propia documentación de NVIDIA indica que los despliegues de una sola GPU y un solo modelo no necesitan Dynamo, así que no existe un caso de uso significativo de "nivel económico" aquí
NVIDIA Dynamo frente a GPUStack: ¿cuál es la diferencia?
NVIDIA Dynamo y GPUStack ayudan a coordinar recursos de GPU para el servicio de LLM, pero operan a escalas distintas: GPUStack gestiona y agrupa GPU heterogéneas en un clúster para ejecutar modelos, mientras que Dynamo orquesta el enrutamiento de solicitudes, el prefill/decode desagregado y el autoescalado sobre un clúster de GPU a gran escala ya existente.
Objetivo principal
- NVIDIA Dynamo:
- Orquestar motores de inferencia (vLLM, TensorRT-LLM, SGLang) en muchas GPU/nodos
- GPUStack:
- Agrupar GPU heterogéneas en un clúster manejable para ejecutar modelos
Escala típica
- NVIDIA Dynamo:
- Centro de datos, multi-nodo, a menudo optimizado para hardware NVIDIA
- GPUStack:
- Clústeres pequeños a medianos, GPU de consumo/prosumer mixtas
Técnica clave
- NVIDIA Dynamo:
- Prefill/decode desagregado, enrutamiento consciente de la caché KV
- GPUStack:
- Agrupación y planificación de recursos de GPU en un clúster
Mantenedor
- NVIDIA Dynamo:
- NVIDIA
- GPUStack:
- Proyecto de código abierto (ver la reseña de GPUStack para más detalles)
Estas herramientas pueden ser complementarias en lugar de competir estrictamente — la gestión de clústeres al estilo GPUStack y la orquestación de solicitudes al estilo Dynamo abordan capas distintas de un despliegue a gran escala.
¿Quién debería usar NVIDIA Dynamo?
NVIDIA Dynamo es adecuado para equipos de infraestructura de ML que ejecutan LLM a escala en varias GPU o nodos — no está pensado para aficionados que ejecutan un modelo en una sola máquina.
Para qué no sirve NVIDIA Dynamo
NVIDIA Dynamo no es adecuado para casos de uso de una sola GPU, una sola máquina o IA local para principiantes — es explícitamente una capa de orquestación a escala de centro de datos.
- No es para despliegues de una sola GPU o un solo modelo — la propia documentación de NVIDIA dice que este caso de uso no necesita Dynamo
- No es una herramienta para principiantes o aficionados — asume experiencia operativa con Kubernetes, redes multi-nodo y motores de inferencia
- No es un motor de inferencia independiente — requiere un backend existente (vLLM, TensorRT-LLM o SGLang) para ejecutar modelos realmente
- No ha sido verificado de forma independiente por esta reseña en cuanto a sus multiplicadores de rendimiento publicados — trata las cifras de throughput y latencia de NVIDIA como reportadas por el proveedor hasta probarlas en tu propia carga de trabajo
- No es inequívoco en cuanto a licencia solo a partir de los metadatos propios de GitHub — el archivo LICENSE del repositorio indica Apache-2.0, pero el campo automático de detección de licencia de GitHub muestra por separado NOASSERTION, así que confirma la licencia directamente contra el archivo LICENSE antes de asumir sin más que se aplican los términos estándar de Apache-2.0
Errores comunes al evaluar NVIDIA Dynamo
La mayor parte de la confusión sobre NVIDIA Dynamo viene de esperar que se comporte como una herramienta de inferencia de una sola máquina, o de malinterpretar qué capa de la pila realmente reemplaza.
Competidores y alternativas
NVIDIA Dynamo se compara más a menudo con GPUStack, LMDeploy y los motores de inferencia que puede orquestar, vLLM y SGLang — su principal diferenciador es la orquestación de prefill/decode desagregado, construida específicamente para clústeres de GPU NVIDIA grandes y multi-nodo.
GPUStack
- Best known for:
- Agrupar GPU heterogéneas en un clúster manejable para el servicio de modelos
- Link:
- Reseña de GPUStack
Artículos sobre GPUStack (3)
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AIActualizado 12 de septiembre de 2026
- DreamServer Review: One-Command Local AI Server Stack (2026)Actualizado 19 de septiembre de 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingActualizado 19 de septiembre de 2026
También mencionado en:
- exo Review: Distributed AI Inference Across Multiple DevicesActualizado 12 de septiembre de 2026
LMDeploy
- Best known for:
- Kit de servicio e inferencia de LLM distribuida con soporte de cuantización
- Link:
- Reseña de LMDeploy
Artículos sobre LMDeploy (1)
- LMDeploy Review: High-Throughput LLM Serving and QuantizationActualizado 19 de septiembre de 2026
También mencionado en:
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingActualizado 19 de septiembre de 2026
- LoRAX Review: Serving Thousands of LoRA Adapters on One GPUActualizado 19 de septiembre de 2026
- Shimmy Review 2026: A 5MB Rust Alternative to OllamaActualizado 19 de septiembre de 2026
- TurboFieldfare Review: Running Gemma 4 26B-A4B in 2 GB of RAMActualizado 19 de septiembre de 2026
vLLM
- Best known for:
- Motor de inferencia de alto rendimiento y compatible con OpenAI, un backend común de Dynamo
- Link:
- vLLM explicado
Artículos sobre vLLM (10)
- vLLM Explained: High-Throughput LLM Serving with PagedAttention (2026)Actualizado 6 de septiembre de 2026
- llama.cpp Explained: The Engine Powering Ollama (2026)Actualizado 20 de septiembre de 2026
- Nanobot Review: A Self-Hosted AI Agent Framework in 2026Actualizado 20 de septiembre de 2026
- candle-vllm Review: Rust-Native LLM Serving on CUDA and MetalActualizado 19 de septiembre de 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingActualizado 19 de septiembre de 2026
- KServe Review: Kubernetes-Native Model Serving at ScaleActualizado 19 de septiembre de 2026
- LMDeploy Review: High-Throughput LLM Serving and QuantizationActualizado 19 de septiembre de 2026
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API ServerActualizado 19 de septiembre de 2026
- TranslateBooksWithLLMs Review: Translate Full Books With a Local or Cloud LLMActualizado 19 de septiembre de 2026
- vllm-mlx Review: vLLM-Style Serving for Apple SiliconActualizado 19 de septiembre de 2026
+81 más no mostrados
SGLang
- Best known for:
- Motor de inferencia compatible con OpenAI con optimizaciones de generación estructurada, un backend común de Dynamo
- Link:
- SGLang explicado
Artículos sobre SGLang (5)
- SGLang Explained: RadixAttention and Structured LLM Serving (2026)Actualizado 6 de septiembre de 2026
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingActualizado 19 de septiembre de 2026
- GPUStack Review 2026: Open-Source GPU Cluster Manager for Local AIActualizado 12 de septiembre de 2026
- Kilo Code Review: The Open-Source Coding Agent Now Owned by AnacondaActualizado 12 de septiembre de 2026
- Text-Generation-WebUI vs vLLM vs llama.cpp in 2026: Inference Engine ComparisonActualizado 29 de agosto de 2026
También mencionado en:
- AIClient2API Review: One Local Proxy for Every AI ProtocolActualizado 19 de septiembre de 2026
- LMDeploy Review: High-Throughput LLM Serving and QuantizationActualizado 19 de septiembre de 2026
- OpenLLM Review 2026: BentoML's Self-Hostable LLM API ServerActualizado 19 de septiembre de 2026
- Locally Uncensored Review 2026: Local Chat, Image, and Video in One AppActualizado 12 de septiembre de 2026
Esta lista refleja herramientas comúnmente evaluadas junto a NVIDIA Dynamo, no un ranking independiente de PromptQuorum — verifica el conjunto de funciones y los requisitos de hardware actuales de cada herramienta antes de elegir.
Preguntas frecuentes
¿Qué es NVIDIA Dynamo?
NVIDIA Dynamo (github.com/ai-dynamo/dynamo) es un framework gratuito, de código abierto, de servicio de inferencia distribuida a escala de centro de datos que orquesta motores de inferencia como vLLM, TensorRT-LLM y SGLang en varias GPU y nodos.
¿Es gratuito NVIDIA Dynamo?
Sí, el framework en sí es gratuito y de código abierto. El archivo LICENSE de su repositorio indica Apache-2.0. Sigues pagando la infraestructura de GPU y clúster que orquesta.
¿Necesito NVIDIA Dynamo para ejecutar un LLM local en mi propia computadora?
No. La propia documentación de NVIDIA indica explícitamente que los despliegues de una sola GPU y un solo modelo no necesitan Dynamo. Para una sola máquina, usa directamente un motor de inferencia como vLLM o un runtime local más simple.
¿NVIDIA Dynamo reemplaza a vLLM o TensorRT-LLM?
No, los orquesta. Dynamo es una capa de coordinación que se sitúa sobre motores de inferencia existentes —vLLM, TensorRT-LLM y SGLang— en lugar de reemplazar a ninguno de ellos.
¿Qué es el servicio de prefill/decode desagregado?
Es una técnica que divide la fase de prefill (procesar el prompt de entrada) y la fase de decode (generar los tokens de salida) en pools de GPU escalables por separado, de modo que cada fase pueda usar hardware dimensionado para las características de su propia carga de trabajo.
¿Quién mantiene NVIDIA Dynamo?
NVIDIA lo mantiene como un proyecto de código abierto bajo la organización de GitHub ai-dynamo.
¿La licencia de NVIDIA Dynamo es Apache-2.0 o NOASSERTION?
El propio archivo LICENSE del repositorio indica Apache-2.0. El campo separado y automático de metadatos de detección de licencia de GitHub muestra NOASSERTION para el mismo repositorio — esta reseña considera el archivo LICENSE como la fuente autorizada.
¿Qué hardware requiere NVIDIA Dynamo?
No hay un mínimo único documentado, ya que está diseñado para despliegues a escala de centro de datos, multi-GPU y multi-nodo, en lugar de un piso fijo de hardware de consumo. También espera Linux y, para su conjunto completo de funciones, interconexiones rápidas como NVLink/NIXL.
¿Cómo instalo NVIDIA Dynamo?
Las rutas comunes son imágenes Docker por backend, `uv pip install --prerelease=allow "ai-dynamo[sglang]"` (cambiando el extra de backend), o un despliegue de Kubernetes/Helm para producción. Verifica primero los nombres de paquete e imagen actuales en el repositorio de GitHub.
¿Ha verificado PromptQuorum de forma independiente las afirmaciones de rendimiento de NVIDIA para Dynamo?
No. Esta reseña se basa en el propio repositorio de GitHub de NVIDIA y su documentación. Las cifras específicas de throughput y latencia son los propios benchmarks publicados por NVIDIA, no cifras que PromptQuorum haya reproducido de forma independiente.