Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/NVIDIA Dynamo: reseña de un servicio de inferencia a escala de centro de datos
Overview & Reference

NVIDIA Dynamo: reseña de un servicio de inferencia a escala de centro de datos

·10 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

NVIDIA Dynamo es un framework gratuito, de código abierto, de servicio de inferencia distribuida a escala de centro de datos que orquesta motores de inferencia —vLLM, TensorRT-LLM y SGLang— en varias GPU y nodos, en lugar de ejecutar la inferencia por sí mismo. Está dirigido a equipos que despliegan modelos de lenguaje de gran tamaño a escala en un centro de datos o clúster en la nube, usando servicio de prefill/decode desagregado y enrutamiento consciente de la caché KV; la propia documentación de NVIDIA indica explícitamente que los despliegues de una sola GPU y un solo modelo no lo necesitan.

NVIDIA Dynamo (github.com/ai-dynamo/dynamo) es un framework gratuito, de código abierto, de servicio de inferencia distribuida a escala de centro de datos que orquesta motores de inferencia como vLLM, TensorRT-LLM y SGLang en varias GPU y nodos, con más de 8.100 estrellas en GitHub. Esta reseña complementa la entrada de NVIDIA Dynamo en el Directorio de Software de LLM Local y explica qué hace realmente, para quién está pensado y dónde encaja — esta no es una herramienta para aficionados de una sola máquina.

Conclusiones clave

  • NVIDIA Dynamo (github.com/ai-dynamo/dynamo) es un framework gratuito, de código abierto, de servicio de inferencia distribuida a escala de centro de datos
  • Licencia: el archivo LICENSE del repositorio indica Apache-2.0; el propio campo de metadatos de la API de GitHub reporta por separado NOASSERTION para el mismo repositorio — verificado directamente contra el archivo LICENSE
  • Orquesta motores de inferencia ya existentes —vLLM, TensorRT-LLM y SGLang— en lugar de reemplazarlos
  • Técnicas principales: servicio de prefill/decode desagregado, enrutamiento consciente de la caché KV, un KV Block Manager para descargar la caché a CPU/SSD/almacenamiento remoto, y un autoescalador orientado a SLA llamado Planner
  • Explícitamente construido para despliegues multi-GPU y multi-nodo en centros de datos o clústeres en la nube — la propia documentación de NVIDIA indica que los casos de uso de una sola GPU y un solo modelo no lo necesitan
  • Más de 8.100 estrellas en GitHub, más de 1.590 forks y un gran número de issues abiertos (más de 1.500) al momento de esta reseña

📍 En una frase

NVIDIA Dynamo es un framework gratuito, de código abierto, de servicio de inferencia distribuida a escala de centro de datos con más de 8.100 estrellas en GitHub que orquesta vLLM, TensorRT-LLM y SGLang en varias GPU y nodos mediante servicio de prefill/decode desagregado y enrutamiento consciente de la caché KV.

💬 En términos simples

NVIDIA Dynamo no es un ejecutor de modelos que instalas en una laptop — es una capa de coordinación que los equipos grandes colocan frente a un motor de inferencia (como vLLM) cuando ejecutan modelos en muchas GPU o muchos servidores a la vez, de modo que las solicitudes se enruten de forma eficiente y el clúster escale automáticamente para cumplir objetivos de latencia.

📌Nota: Esta reseña se basa en el propio repositorio de GitHub de Dynamo de NVIDIA y su documentación. Las cifras de rendimiento, como los multiplicadores de throughput específicos, son los propios benchmarks publicados por NVIDIA, no cifras que PromptQuorum haya reproducido de forma independiente — trátalas como reportadas por el proveedor hasta que se verifiquen en tu propio hardware y carga de trabajo.

¿Qué es NVIDIA Dynamo?

NVIDIA Dynamo es un framework gratuito y de código abierto que coordina cómo se sirven los modelos de lenguaje de gran tamaño en varias GPU y nodos dentro de un centro de datos o clúster en la nube, en lugar de ejecutar la inferencia por sí mismo. NVIDIA lo describe como la capa de orquestación por encima de los motores de inferencia, que transforma un clúster de GPU en un único sistema de inferencia coordinado.

  • Tipo de producto: un framework de orquestación de inferencia distribuida — no un motor de inferencia independiente, un ejecutor de modelos ni una app de escritorio
  • Mantenedor: NVIDIA, desarrollado como un proyecto de código abierto bajo la organización de GitHub ai-dynamo
  • Licencia: el archivo LICENSE del repositorio es Apache-2.0; ten en cuenta que los metadatos automáticos de detección de licencia de GitHub para el mismo repositorio muestran por separado NOASSERTION — esta reseña considera el propio archivo LICENSE como la fuente autorizada
  • Repositorio creado en marzo de 2025, según los metadatos de GitHub
  • Escala: más de 8.100 estrellas en GitHub y más de 1.590 forks al momento de esta reseña, con un número de issues abiertos inusualmente alto (más de 1.500) para un proyecto de este tamaño — típico de un proyecto de infraestructura de rápido movimiento y alta contribución, pero algo a tener en cuenta en cualquier evaluación de preparación para producción

¿Cuál es el historial de versiones de NVIDIA Dynamo?

NVIDIA Dynamo publica etiquetas de versión específicas por modelo y por plataforma a un ritmo rápido, con etiquetas de desarrollo activas en el rango v1.4–v1.6 al momento de esta reseña.

  • Los lanzamientos etiquetados recientes incluyen compilaciones específicas por modelo y por plataforma (por ejemplo, versiones vinculadas a familias de modelos específicas como DeepSeek, Kimi o Solar), lo que refleja lo de cerca que el proyecto sigue los nuevos lanzamientos de modelos de peso abierto
  • El proyecto alcanzó hitos de preparación para producción general que NVIDIA describe como incluyendo despliegue sin configuración, soporte de inferencia agéntica, manejo multimodal de codificación/prefill/decode y soporte nativo de generación de video
  • Los propios resultados publicados por NVIDIA para versiones posteriores citan mejoras sustanciales de throughput en combinaciones específicas de modelo/hardware (por ejemplo, DeepSeek R1 y sistemas NVIDIA GB300 NVL72) — se trata de benchmarks reportados por el proveedor, no de cifras que PromptQuorum haya verificado de forma independiente

¿Qué hace realmente NVIDIA Dynamo?

NVIDIA Dynamo se sitúa frente a uno o varios motores de inferencia y decide cómo enrutar, agrupar (batch) y escalar solicitudes en un clúster de GPU para cumplir objetivos de latencia y costo.

  • Servicio desagregado: divide las fases de prefill y decode de la inferencia en pools de GPU escalables de forma independiente, de modo que cada fase pueda usar hardware dimensionado para su propia carga de trabajo
  • Enrutamiento consciente de la caché KV: enruta solicitudes según la carga de cada worker y el solapamiento existente de la caché de clave-valor para evitar cómputo redundante, lo que la documentación de NVIDIA describe como una reducción aproximada a la mitad del tiempo hasta el primer token en configuraciones compatibles
  • KV Block Manager (KVBM): descarga las cachés de clave-valor entre GPU, CPU, SSD y almacenamiento remoto para extender la longitud efectiva de contexto más allá de la memoria de una sola GPU
  • Planner: un autoescalador orientado a SLA que perfila cargas de trabajo y redimensiona los pools de GPU para cumplir objetivos de latencia a un menor costo total de propiedad
  • ModelExpress: transmite los pesos del modelo de GPU a GPU mediante NIXL/NVLink, lo que la documentación de NVIDIA describe como una reducción sustancial del tiempo de arranque en frío para nuevas réplicas
  • Soporte de backends: integración completa con vLLM, TensorRT-LLM y SGLang, con una matriz de funciones documentada que cubre el soporte por backend de adaptadores LoRA, migración de solicitudes y decodificación especulativa

¿Cómo se despliega NVIDIA Dynamo?

NVIDIA Dynamo se despliega típicamente mediante contenedores Docker por backend de inferencia, se instala vía pip para desarrollo, o se implementa en un clúster con Kubernetes y charts de Helm.

  • Docker: NVIDIA publica imágenes de contenedor precompiladas por backend (por ejemplo, sglang-runtime, tensorrtllm-runtime, vllm-runtime) a través de su registro de contenedores
  • Python/pip: instala con un extra específico de backend, por ejemplo `uv pip install --prerelease=allow "ai-dynamo[sglang]"`, cambiando el extra entre corchetes por el backend elegido
  • Compilación desde el código fuente: se admite una compilación completa en Rust y Python desde el código fuente para colaboradores, lo que requiere build-essential y el toolchain de Rust
  • Kubernetes: los despliegues de producción suelen usar charts de Helm y los manifiestos YAML sin configuración de NVIDIA, que aplican automáticamente el autoescalado orientado a SLA
bash
uv pip install --prerelease=allow "ai-dynamo[sglang]"

Plataforma, precios y licencia

Plataforma

Lo que indica NVIDIA Dynamo:
Framework de servicio distribuido basado en Linux y orientado a centros de datos/Kubernetes — sin ruta de instalación para consumidor de una sola máquina.

Costo

Lo que indica NVIDIA Dynamo:
Gratuito y de código abierto. Sigues pagando las GPU, la infraestructura de clúster y los costos en la nube que orquesta.

Licencia

Lo que indica NVIDIA Dynamo:
El archivo LICENSE del repositorio es Apache-2.0; el campo separado de metadatos de licencia de GitHub muestra NOASSERTION para el mismo repositorio.

Método de instalación

Lo que indica NVIDIA Dynamo:
Imágenes Docker por backend, pip/uv pip con un extra de backend, Kubernetes/Helm, o una compilación completa desde el código fuente.

Verifica la ruta de instalación recomendada actual y las etiquetas de contenedor en github.com/ai-dynamo/dynamo, ya que las imágenes específicas por backend y los extras de paquete cambian entre versiones.

¿Cuánto cuesta NVIDIA Dynamo?

NVIDIA Dynamo en sí es gratuito — no tiene tarifa de licencia, suscripción ni cargo por uso. Tu costo real es el hardware de GPU, la infraestructura en la nube y la red que orquesta, lo cual suele ser considerable en un despliegue multi-nodo.

  • El framework: gratuito, de código abierto (Apache-2.0 según su archivo LICENSE), sin nivel de pago
  • Costos de infraestructura: múltiples GPU, a menudo en varios nodos, más interconexiones rápidas (NVLink/NIXL) para obtener todo el beneficio de sus funciones de transmisión de pesos y descarga de caché KV
  • No es adecuado para presupuestos de una sola GPU: la propia documentación de NVIDIA indica que los despliegues de una sola GPU y un solo modelo no necesitan Dynamo, así que no existe un caso de uso significativo de "nivel económico" aquí

NVIDIA Dynamo frente a GPUStack: ¿cuál es la diferencia?

NVIDIA Dynamo y GPUStack ayudan a coordinar recursos de GPU para el servicio de LLM, pero operan a escalas distintas: GPUStack gestiona y agrupa GPU heterogéneas en un clúster para ejecutar modelos, mientras que Dynamo orquesta el enrutamiento de solicitudes, el prefill/decode desagregado y el autoescalado sobre un clúster de GPU a gran escala ya existente.

Objetivo principal

NVIDIA Dynamo:
Orquestar motores de inferencia (vLLM, TensorRT-LLM, SGLang) en muchas GPU/nodos
GPUStack:
Agrupar GPU heterogéneas en un clúster manejable para ejecutar modelos

Escala típica

NVIDIA Dynamo:
Centro de datos, multi-nodo, a menudo optimizado para hardware NVIDIA
GPUStack:
Clústeres pequeños a medianos, GPU de consumo/prosumer mixtas

Técnica clave

NVIDIA Dynamo:
Prefill/decode desagregado, enrutamiento consciente de la caché KV
GPUStack:
Agrupación y planificación de recursos de GPU en un clúster

Mantenedor

NVIDIA Dynamo:
NVIDIA
GPUStack:
Proyecto de código abierto (ver la reseña de GPUStack para más detalles)

Estas herramientas pueden ser complementarias en lugar de competir estrictamente — la gestión de clústeres al estilo GPUStack y la orquestación de solicitudes al estilo Dynamo abordan capas distintas de un despliegue a gran escala.

¿Quién debería usar NVIDIA Dynamo?

NVIDIA Dynamo es adecuado para equipos de infraestructura de ML que ejecutan LLM a escala en varias GPU o nodos — no está pensado para aficionados que ejecutan un modelo en una sola máquina.

Para qué no sirve NVIDIA Dynamo

NVIDIA Dynamo no es adecuado para casos de uso de una sola GPU, una sola máquina o IA local para principiantes — es explícitamente una capa de orquestación a escala de centro de datos.

  • No es para despliegues de una sola GPU o un solo modelo — la propia documentación de NVIDIA dice que este caso de uso no necesita Dynamo
  • No es una herramienta para principiantes o aficionados — asume experiencia operativa con Kubernetes, redes multi-nodo y motores de inferencia
  • No es un motor de inferencia independiente — requiere un backend existente (vLLM, TensorRT-LLM o SGLang) para ejecutar modelos realmente
  • No ha sido verificado de forma independiente por esta reseña en cuanto a sus multiplicadores de rendimiento publicados — trata las cifras de throughput y latencia de NVIDIA como reportadas por el proveedor hasta probarlas en tu propia carga de trabajo
  • No es inequívoco en cuanto a licencia solo a partir de los metadatos propios de GitHub — el archivo LICENSE del repositorio indica Apache-2.0, pero el campo automático de detección de licencia de GitHub muestra por separado NOASSERTION, así que confirma la licencia directamente contra el archivo LICENSE antes de asumir sin más que se aplican los términos estándar de Apache-2.0

Errores comunes al evaluar NVIDIA Dynamo

La mayor parte de la confusión sobre NVIDIA Dynamo viene de esperar que se comporte como una herramienta de inferencia de una sola máquina, o de malinterpretar qué capa de la pila realmente reemplaza.

Competidores y alternativas

NVIDIA Dynamo se compara más a menudo con GPUStack, LMDeploy y los motores de inferencia que puede orquestar, vLLM y SGLang — su principal diferenciador es la orquestación de prefill/decode desagregado, construida específicamente para clústeres de GPU NVIDIA grandes y multi-nodo.

GPUStack

Best known for:
Agrupar GPU heterogéneas en un clúster manejable para el servicio de modelos
Artículos sobre GPUStack (3)

También mencionado en:

LMDeploy

Best known for:
Kit de servicio e inferencia de LLM distribuida con soporte de cuantización
Artículos sobre LMDeploy (1)

También mencionado en:

vLLM

Best known for:
Motor de inferencia de alto rendimiento y compatible con OpenAI, un backend común de Dynamo
Artículos sobre vLLM (10)

+81 más no mostrados

SGLang

Best known for:
Motor de inferencia compatible con OpenAI con optimizaciones de generación estructurada, un backend común de Dynamo
Artículos sobre SGLang (5)

También mencionado en:

Esta lista refleja herramientas comúnmente evaluadas junto a NVIDIA Dynamo, no un ranking independiente de PromptQuorum — verifica el conjunto de funciones y los requisitos de hardware actuales de cada herramienta antes de elegir.

Preguntas frecuentes

¿Qué es NVIDIA Dynamo?

NVIDIA Dynamo (github.com/ai-dynamo/dynamo) es un framework gratuito, de código abierto, de servicio de inferencia distribuida a escala de centro de datos que orquesta motores de inferencia como vLLM, TensorRT-LLM y SGLang en varias GPU y nodos.

¿Es gratuito NVIDIA Dynamo?

Sí, el framework en sí es gratuito y de código abierto. El archivo LICENSE de su repositorio indica Apache-2.0. Sigues pagando la infraestructura de GPU y clúster que orquesta.

¿Necesito NVIDIA Dynamo para ejecutar un LLM local en mi propia computadora?

No. La propia documentación de NVIDIA indica explícitamente que los despliegues de una sola GPU y un solo modelo no necesitan Dynamo. Para una sola máquina, usa directamente un motor de inferencia como vLLM o un runtime local más simple.

¿NVIDIA Dynamo reemplaza a vLLM o TensorRT-LLM?

No, los orquesta. Dynamo es una capa de coordinación que se sitúa sobre motores de inferencia existentes —vLLM, TensorRT-LLM y SGLang— en lugar de reemplazar a ninguno de ellos.

¿Qué es el servicio de prefill/decode desagregado?

Es una técnica que divide la fase de prefill (procesar el prompt de entrada) y la fase de decode (generar los tokens de salida) en pools de GPU escalables por separado, de modo que cada fase pueda usar hardware dimensionado para las características de su propia carga de trabajo.

¿Quién mantiene NVIDIA Dynamo?

NVIDIA lo mantiene como un proyecto de código abierto bajo la organización de GitHub ai-dynamo.

¿La licencia de NVIDIA Dynamo es Apache-2.0 o NOASSERTION?

El propio archivo LICENSE del repositorio indica Apache-2.0. El campo separado y automático de metadatos de detección de licencia de GitHub muestra NOASSERTION para el mismo repositorio — esta reseña considera el archivo LICENSE como la fuente autorizada.

¿Qué hardware requiere NVIDIA Dynamo?

No hay un mínimo único documentado, ya que está diseñado para despliegues a escala de centro de datos, multi-GPU y multi-nodo, en lugar de un piso fijo de hardware de consumo. También espera Linux y, para su conjunto completo de funciones, interconexiones rápidas como NVLink/NIXL.

¿Cómo instalo NVIDIA Dynamo?

Las rutas comunes son imágenes Docker por backend, `uv pip install --prerelease=allow "ai-dynamo[sglang]"` (cambiando el extra de backend), o un despliegue de Kubernetes/Helm para producción. Verifica primero los nombres de paquete e imagen actuales en el repositorio de GitHub.

¿Ha verificado PromptQuorum de forma independiente las afirmaciones de rendimiento de NVIDIA para Dynamo?

No. Esta reseña se basa en el propio repositorio de GitHub de NVIDIA y su documentación. Las cifras específicas de throughput y latencia son los propios benchmarks publicados por NVIDIA, no cifras que PromptQuorum haya reproducido de forma independiente.

Fuentes

← Volver a LLM locales avanzados