Skip to main content
PromptQuorum
主页/本地LLM进阶/NVIDIA Dynamo评测:数据中心级推理服务
Overview & Reference

NVIDIA Dynamo评测:数据中心级推理服务

·阅读时间10分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

NVIDIA Dynamo是一款免费开源、面向数据中心级的分布式推理服务框架,它在多个GPU和节点之间编排vLLM、TensorRT-LLM、SGLang等推理引擎,而非自己执行推理。它面向在数据中心或云集群中大规模部署大语言模型的团队,采用解耦式预填充/解码服务和感知KV缓存的路由机制;NVIDIA官方文档明确指出,单GPU、单模型的部署场景并不需要它。

NVIDIA Dynamo(github.com/ai-dynamo/dynamo)是一款免费开源、面向数据中心级的分布式推理服务框架,可在多个GPU和节点之间编排vLLM、TensorRT-LLM、SGLang等推理引擎,GitHub星标数已超过8,100。本评测是本地LLM软件目录中NVIDIA Dynamo条目的深度补充,介绍它实际能做什么、面向哪些用户,以及它在整个生态中的定位——这不是一款面向单机个人爱好者的工具。

关键要点

  • NVIDIA Dynamo(github.com/ai-dynamo/dynamo)是一款免费开源、面向数据中心级的分布式推理服务框架
  • 许可协议:仓库的LICENSE文件标明为Apache-2.0;GitHub自身的API元数据字段针对同一仓库单独报告为NOASSERTION——已直接对照LICENSE文件核实
  • 它编排现有的推理引擎——vLLM、TensorRT-LLM和SGLang——而不是取代它们
  • 核心技术:解耦式预填充/解码服务、感知KV缓存的路由、用于将缓存卸载到CPU/SSD/远程存储的KV Block Manager,以及名为Planner的SLA驱动自动扩缩容器
  • 明确面向多GPU、多节点的数据中心或云集群部署——NVIDIA官方文档指出单GPU、单模型的使用场景并不需要它
  • 截至本评测发布时,GitHub星标数超过8,100,分叉数超过1,590,未解决issue数量较多(超过1,500)

📍 简单一句话

NVIDIA Dynamo是一款免费开源、面向数据中心级的分布式推理服务框架,GitHub星标数超过8,100,通过解耦式预填充/解码服务和感知KV缓存的路由机制,在多个GPU和节点之间编排vLLM、TensorRT-LLM和SGLang。

💬 简单来说

NVIDIA Dynamo不是安装在笔记本电脑上的模型运行工具——它是一个协调层,大型团队在同时跨多个GPU或多台服务器运行模型时,会将其置于推理引擎(如vLLM)之前,以便请求得到高效路由,集群也能自动扩缩容以满足延迟目标。

📌: 本评测基于NVIDIA自己的Dynamo GitHub仓库和文档撰写。诸如具体吞吐量倍数之类的性能数据是NVIDIA自行发布的基准测试结果,并非PromptQuorum独立复现的数字——在您自己的硬件和工作负载上验证之前,请将其视为厂商自报数据。

NVIDIA Dynamo是什么?

NVIDIA Dynamo是一款免费开源框架,用于协调大语言模型在数据中心或云集群中跨多个GPU和节点的服务方式,而非自己执行推理。NVIDIA将其描述为推理引擎之上的编排层,可将一组GPU转变为一个统一协调的推理系统。

  • 产品类型:一个分布式推理编排框架——不是独立的推理引擎、模型运行工具或桌面应用
  • 维护方:NVIDIA,作为开源项目在ai-dynamo GitHub组织下开发
  • 许可协议:仓库的LICENSE文件为Apache-2.0;需要注意的是,GitHub针对同一仓库的自动许可证检测元数据单独显示为NOASSERTION——本评测以LICENSE文件本身为准
  • 根据GitHub元数据,该仓库创建于2025年3月
  • 规模:截至本评测发布时,GitHub星标数超过8,100,分叉数超过1,590,对于这个规模的项目而言未解决issue数量异常多(超过1,500)——这是快速发展、贡献活跃的基础设施项目的典型特征,但在评估生产就绪度时值得纳入考量

NVIDIA Dynamo的版本历史是怎样的?

NVIDIA Dynamo以较快的节奏发布针对特定模型和平台的发行标签,截至本评测撰写时,活跃开发标签处于v1.4至v1.6区间。

  • 近期打标签的版本包含针对特定模型和平台的构建(例如与DeepSeek、Kimi或Solar等特定模型系列绑定的发行版),反映出该项目对新开放权重模型发布的紧密追踪
  • 该项目达到了NVIDIA所描述的通用生产就绪里程碑,包括零配置部署、智能体推理支持、多模态编码/预填充/解码处理,以及原生视频生成支持
  • NVIDIA自行发布的后续版本结果显示,在特定的模型/硬件组合(例如DeepSeek R1与NVIDIA GB300 NVL72系统)上有可观的吞吐量提升——这些是厂商自报的基准测试数据,并非PromptQuorum独立核实的数字

NVIDIA Dynamo实际能做什么?

NVIDIA Dynamo位于一个或多个推理引擎之前,决定如何在GPU集群中路由、批处理和扩缩容请求,以达到延迟与成本目标。

  • 解耦式服务:将推理的预填充和解码阶段拆分到可独立扩展的GPU资源池上,使每个阶段都能使用针对自身工作负载规模化配置的硬件
  • 感知KV缓存的路由:根据工作节点负载和现有键值缓存的重叠情况路由请求,以避免冗余计算,NVIDIA文档称这在受支持的配置中可将首个token生成时间大致减半
  • KV Block Manager(KVBM):将键值缓存卸载到GPU、CPU、SSD和远程存储之间,从而将有效上下文长度扩展到单个GPU显存之外
  • Planner:一个SLA驱动的自动扩缩容器,可对工作负载进行画像分析,并调整GPU资源池规模,以更低的总体拥有成本达成延迟目标
  • ModelExpress:通过NIXL/NVLink实现GPU间模型权重流式传输,NVIDIA文档称这能大幅缩短新副本的冷启动时间
  • 后端支持:与vLLM、TensorRT-LLM和SGLang完全集成,并有文档记录的功能矩阵,涵盖各后端对LoRA适配器、请求迁移和推测解码的支持情况

如何部署NVIDIA Dynamo?

NVIDIA Dynamo通常按推理后端以Docker容器方式部署,开发环境下通过pip安装,或使用Kubernetes与Helm chart推送到集群。

  • Docker:NVIDIA通过自己的容器镜像仓库为各后端发布预构建的容器镜像(例如sglang-runtime、tensorrtllm-runtime、vllm-runtime)
  • Python/pip:安装时附带特定后端的extra,例如`uv pip install --prerelease=allow "ai-dynamo[sglang]"`,将方括号中的extra替换为您选择的后端
  • 源码构建:支持贡献者从源码进行完整的Rust与Python构建,需要build-essential和Rust工具链
  • Kubernetes:生产环境部署通常使用Helm chart和NVIDIA的零配置YAML清单,后者会自动应用SLA驱动的自动扩缩容
bash
uv pip install --prerelease=allow "ai-dynamo[sglang]"

平台、价格与许可

平台

NVIDIA Dynamo的说明:
基于Linux、面向数据中心/Kubernetes的分布式服务框架——没有面向单机消费者的安装路径。

费用

NVIDIA Dynamo的说明:
免费且开源。您仍需为它所编排的GPU、集群基础设施和云服务费用付费。

许可协议

NVIDIA Dynamo的说明:
仓库的LICENSE文件为Apache-2.0;GitHub针对同一仓库的独立许可证元数据字段显示为NOASSERTION。

安装方式

NVIDIA Dynamo的说明:
按后端提供的Docker镜像、带后端extra的pip/uv pip、Kubernetes/Helm,或完整源码构建。

请在github.com/ai-dynamo/dynamo核实当前推荐的安装路径和容器标签,因为特定后端的镜像和包extra会随版本变化。

NVIDIA Dynamo的费用是多少?

NVIDIA Dynamo本身是免费的——没有许可费、订阅费或按使用量计费。您的实际成本在于它所编排的GPU硬件、云基础设施和网络,对于多节点部署而言,这通常是一笔可观的支出。

  • 框架本身:免费、开源(根据其LICENSE文件为Apache-2.0),没有付费层级
  • 基础设施成本:多个GPU,通常跨多个节点,还需要快速互连网络(NVLink/NIXL),才能充分发挥其权重流式传输和KV卸载功能的优势
  • 不适合单GPU预算:NVIDIA官方文档指出单GPU、单模型部署并不需要Dynamo,因此这里并不存在有意义的"预算级"使用场景

NVIDIA Dynamo对比GPUStack:区别是什么?

NVIDIA Dynamo与GPUStack都能帮助协调用于LLM服务的GPU资源,但二者的作用层级不同:GPUStack负责管理并将异构GPU汇聚成一个集群用于运行模型,而Dynamo则在已有的大规模GPU集群之上编排请求路由、解耦式预填充/解码以及自动扩缩容。

主要目标

NVIDIA Dynamo:
在众多GPU/节点之间编排推理引擎(vLLM、TensorRT-LLM、SGLang)
GPUStack:
将异构GPU汇聚成一个可管理的集群用于运行模型

典型规模

NVIDIA Dynamo:
数据中心、多节点,通常针对NVIDIA硬件优化
GPUStack:
中小型集群,混合消费级/专业级GPU

关键技术

NVIDIA Dynamo:
解耦式预填充/解码、感知KV缓存的路由
GPUStack:
跨集群的GPU资源池化与调度

维护方

NVIDIA Dynamo:
NVIDIA
GPUStack:
开源项目(详情参见GPUStack评测)

这两款工具可以互补,而非严格竞争——GPUStack式的集群管理与Dynamo式的请求编排,解决的是大规模部署中不同层面的问题。

谁适合使用NVIDIA Dynamo?

NVIDIA Dynamo适合在多个GPU或节点上大规模运行LLM的机器学习基础设施团队——它不是面向在单台机器上运行模型的个人爱好者。

NVIDIA Dynamo不适合哪些场景

NVIDIA Dynamo并不适合单GPU、单机或新手本地AI使用场景——它明确是一个数据中心级的编排层。

  • 不适合单GPU或单模型部署——NVIDIA官方文档表示这种使用场景不需要Dynamo
  • 不是新手或爱好者工具——它默认您具备Kubernetes、多节点网络和推理引擎的运维经验
  • 不是独立的推理引擎——它需要依赖已有的后端(vLLM、TensorRT-LLM或SGLang)才能实际运行模型
  • 本评测未对其具体的性能倍数宣传进行独立核实——在您自己的工作负载上测试之前,请将NVIDIA给出的吞吐量和延迟数据视为厂商自报
  • 仅凭GitHub自身元数据无法得出明确许可结论——仓库的LICENSE文件标明为Apache-2.0,但GitHub的自动许可证检测字段针对同一仓库单独显示为NOASSERTION,因此在不加确认就默认适用标准Apache-2.0条款之前,请直接对照LICENSE文件核实许可情况

评估NVIDIA Dynamo时的常见误区

关于NVIDIA Dynamo的大多数困惑,都源于期望它表现得像单机推理工具,或者误解了它实际替代的是技术栈中的哪一层。

竞品与替代方案

NVIDIA Dynamo最常被拿来与GPUStackLMDeploy,以及它能够编排的推理引擎vLLMSGLang进行比较——它的主要差异化优势在于专为大规模多节点NVIDIA GPU集群打造的解耦式预填充/解码编排能力。

GPUStack

主要特点:
将异构GPU汇聚成一个可管理的集群用于模型服务
关于GPUStack的文章(3篇)

其他提及:

LMDeploy

主要特点:
支持量化的分布式LLM服务与推理工具包
关于LMDeploy的文章(1篇)

其他提及:

vLLM

主要特点:
高吞吐量、兼容OpenAI接口的推理引擎,是Dynamo常用的后端之一
链接:
vLLM详解
关于vLLM的文章(10篇)

另有81篇未显示

SGLang

主要特点:
兼容OpenAI接口且针对结构化生成进行了优化的推理引擎,是Dynamo常用的后端之一
关于SGLang的文章(5篇)

其他提及:

此列表反映的是常与NVIDIA Dynamo一同被评估的工具,并非PromptQuorum的独立排名——选择之前请核实每款工具当前的功能集和硬件要求。

常见问题

NVIDIA Dynamo是什么?

NVIDIA Dynamo(github.com/ai-dynamo/dynamo)是一款免费开源、面向数据中心级的分布式推理服务框架,可在多个GPU和节点之间编排vLLM、TensorRT-LLM、SGLang等推理引擎。

NVIDIA Dynamo是免费的吗?

是的,该框架本身免费且开源。其仓库的LICENSE文件标明为Apache-2.0。您仍需为它所编排的GPU和集群基础设施付费。

在自己的电脑上运行本地LLM需要NVIDIA Dynamo吗?

不需要。NVIDIA官方文档明确指出,单GPU、单模型部署并不需要Dynamo。对于单台机器,请直接使用vLLM等推理引擎或更简单的本地运行环境。

NVIDIA Dynamo会取代vLLM或TensorRT-LLM吗?

不会,它是对它们进行编排。Dynamo是位于现有推理引擎——vLLM、TensorRT-LLM和SGLang——之上的协调层,而不是取代其中任何一个。

什么是解耦式预填充/解码服务?

这是一种将推理的预填充阶段(处理输入提示)和解码阶段(生成输出token)拆分到可分别扩展的GPU资源池上的技术,使每个阶段都能使用针对自身工作负载特点规模化配置的硬件。

谁在维护NVIDIA Dynamo?

NVIDIA在ai-dynamo GitHub组织下将其作为开源项目进行维护。

NVIDIA Dynamo的许可协议究竟是Apache-2.0还是NOASSERTION?

仓库自身的LICENSE文件标明为Apache-2.0。GitHub针对同一仓库的独立自动许可证检测元数据字段显示为NOASSERTION——本评测以LICENSE文件为准。

NVIDIA Dynamo需要什么硬件?

没有单一的文档化最低配置,因为它的设计面向数据中心级、多GPU、多节点部署,而非固定的消费级硬件门槛。它还要求使用Linux,若要发挥完整功能,通常还需要NVLink/NIXL等高速互连网络。

如何安装NVIDIA Dynamo?

常见方式包括按后端提供的Docker镜像、`uv pip install --prerelease=allow "ai-dynamo[sglang]"`(替换为对应的后端extra),或用于生产环境的Kubernetes/Helm部署。请先在GitHub仓库核实当前的包名和镜像名称。

PromptQuorum是否独立核实过NVIDIA关于Dynamo的性能宣传?

没有。本评测基于NVIDIA自己的GitHub仓库和文档撰写。具体的吞吐量和延迟数据是NVIDIA自行发布的基准测试结果,并非PromptQuorum独立复现的数字。

资料来源

← 返回 本地LLM进阶