关键要点
- GPUStack是一款用于AI模型服务的开源GPU集群管理器;源代码位于github.com/gpustack/gpustack,项目网站为gpustack.ai
- 服务器-工作节点集群架构:一个中央服务器编排一个或多个工作节点,每个节点都为共享资源池贡献GPU算力
- 编排多个推理后端——llama-box(自研的llama.cpp/stable-diffusion.cpp实现)、vLLM、SGLang、TensorRT-LLM和Ascend MindIE——并支持添加自定义引擎
- 根据官方文档,支持异构硬件:NVIDIA和AMD GPU、华为Ascend NPU以及海光DCU
- 许可证:Apache License 2.0——完全开源;截至本评测撰写时,项目公开网站上未记录单独的付费或"企业版"层级
- 主要通过Docker安装,配有面向Kubernetes的Helm chart和面向离线环境的air-gapped路径;遗留的curl安装脚本仍然存在,但自GPUStack v0.7起已被弃用
- 工作节点仅支持Linux: 服务器可通过Docker在Linux、macOS或Windows上运行,但根据官方文档,只有Linux机器才能作为贡献GPU算力的工作节点
- 提供OpenAI兼容API,并能按需配置可通过SSH访问的GPU实例,而不仅仅是一个推理端点
- 截至2026年9月5日,经与github.com/gpustack/gpustack核实,其GitHub仓库显示为5,607颗星
📍 简单一句话
GPUStack是一款开源GPU集群管理器,可在多个GPU和机器上自动配置并编排推理引擎(llama-box、vLLM、SGLang、TensorRT-LLM、Ascend MindIE),与Ollama等单机工具不同。
💬 简单来说
GPUStack让团队可以将多个GPU——即使分布在不同的物理机器上——整合成一个便于管理的集群来运行AI模型,而不是让每个GPU各自闲置在自己的机箱里。它会为任务选择合适的推理引擎,并允许按需通过SSH访问集群中的机器。它不是一台笔记本电脑上的聊天应用;它解决的是扩展问题,而不是"在我的电脑上运行一个模型"的问题。
📌注: 本评测是本地LLM软件目录中GPUStack条目的深度补充——请查看该页面了解GPUStack与其他数十种本地AI工具的整体对比。
GPUStack是什么
GPUStack是一款用于AI模型服务和GPU实例配置的开源GPU集群管理器。其GitHub仓库将其描述为可在异构GPU硬件上自动配置并编排推理引擎,目标是那些需要将多个GPU——可能分布在多台物理机器上——整合成一个便于管理的推理集群的团队,而非在单一设备上运行模型。
- 核心功能:在GPU和机器组成的集群中编排LLM推理(以及通过llama-box的stable-diffusion.cpp支持进行的图像生成),而非在单一设备上进行
- 架构:一个中央GPUStack服务器协调一个或多个工作节点,每个节点为共享资源池贡献GPU算力
- 编排的后端:llama-box(GPUStack基于llama.cpp和stable-diffusion.cpp自研的推理服务器实现)、vLLM、SGLang、TensorRT-LLM,以及面向华为Ascend NPU硬件的Ascend MindIE,并支持添加自定义推理引擎
- 硬件支持:根据官方文档,支持包括NVIDIA和AMD GPU、华为Ascend NPU及海光DCU在内的异构加速器
- 按需GPU实例:GPUStack可以配置可通过SSH访问的GPU实例,让用户能够直接在集群中的机器上工作,而不仅仅通过API
- 规范仓库:github.com/gpustack/gpustack;项目网站:gpustack.ai
GPUStack发展里程碑
GPUStack作为一款开源集群管理器发布,旨在整合本地硬件上的GPU算力,服务于那些需要在超出单一机器算力范围的场景中提供模型服务的团队。
- 1首次发布——开源GPU集群管理器
Why it matters: GPUStack一经推出,就明确定位为在集群范围内编排GPU算力,填补了Ollama等单机运行环境与完整企业级推理服务栈之间的空白。 - 2持续进行——多后端编排(llama-box、vLLM、SGLang、TensorRT-LLM)
Why it matters: 支持多个推理引擎而非单一引擎,使GPUStack能够将工作负载路由到最适合该模型和硬件的后端,而不是把用户锁定在单一引擎上。 - 3持续进行——新增对Ascend MindIE和海光DCU的支持
Why it matters: 将后端和硬件支持扩展到华为Ascend NPU和海光DCU,而不仅限于NVIDIA和AMD GPU,拓宽了集群实际可以利用的本地硬件范围。 - 4持续进行——Docker和Helm确立为主要安装路径;遗留curl脚本在v0.7版本被弃用
Why it matters: 围绕Docker和面向Kubernetes的Helm chart而非shell脚本安装程序进行整合,体现出GPUStack被定位为由团队管理的基础设施软件,而非一次性的开发者安装工具。 - 5持续进行——截至2026年9月5日拥有5,607颗GitHub星标
Why it matters: 星标数是一个大致的使用信号,而非质量基准,但它表明在大多数本地AI用户从未接触过的集群管理这一类别中,确实存在真实的采用情况。
GPUStack能做什么
根据其官方文档,GPUStack的功能集聚焦于让多GPU、多机器的推理可以从一个地方统一管理。
- 多后端推理编排——根据模型和硬件自动配置并运行llama-box、vLLM、SGLang、TensorRT-LLM或Ascend MindIE,并支持添加自定义推理引擎
- 跨异构硬件的集群调度——根据官方文档,将NVIDIA和AMD GPU、华为Ascend NPU以及海光DCU整合为一个可统一调度的资源池
- 按需的、可通过SSH访问的GPU实例——不仅提供一个推理API端点,还能配置用户可以直接SSH登录的实例
- OpenAI兼容API——经官方文档确认;现有的OpenAI客户端代码只需极少改动即可指向由GPUStack管理的端点
- 内置的llama-box引擎——GPUStack基于llama.cpp和stable-diffusion.cpp自研的实现,支持CPU推理、OpenAI Function-calling API、OpenAI Embeddings API兼容以及推测解码
- Web管理界面和CLI——根据官方快速入门文档,服务器在提供CLI和API访问的同时,还提供一个Web界面(默认端口80)
- 通过Helm实现Kubernetes原生部署——对于已经运行Kubernetes的团队,GPUStack提供官方Helm chart,而不需要定制化部署
- 离线安装路径——为无网络访问的环境提供文档说明,适用于本地或受监管的部署场景
使用示例:三种使用GPUStack的方式
以下是根据GPUStack已记录的Docker安装、快速入门指南和API整理出的工作流程——并非假设性用例。
安装与入门
GPUStack是一款自托管的服务器与集群工具,而不是带下载按钮的消费级应用,因此安装是通过Docker、Helm chart,或(遗留方式)shell脚本进行的,而不是通过营销页面上的签名安装程序。
- 1Docker(根据官方文档,为当前推荐的方式):在将作为GPUStack服务器的机器上运行
sudo docker run -d --name gpustack --restart unless-stopped -p 80:80 --volume gpustack-data:/var/lib/gpustack gpustack/gpustack;服务器本身可以在Linux、macOS或通过Docker Desktop在Windows上运行。 - 2Kubernetes:如果您的团队已经运行Kubernetes,请根据安装文档部署官方Helm chart。
- 3离线环境:如果目标机器没有网络访问,请遵循文档中记录的air-gapped安装路径。
- 4GPUStack的发布历史中还提到了适用于macOS和Windows的桌面安装程序,可在不使用Docker的情况下搭建服务器——由于截至本评测撰写时它并非主要文档导航的一部分,请直接在gpustack.ai上确认当前的下载链接。
- 5遗留的、偏向Linux的替代方式:
curl -sfL https://get.gpustack.ai | sh -s -——此安装脚本仍然可用,但自GPUStack v0.7起已被弃用,取而代之的是上述Docker和Helm路径;请将其视为备用方案,而非新装的默认选择。 - 6若要扩展到多台机器,请将其他Linux机器作为工作节点加入集群。工作节点仅支持Linux——macOS不支持工作节点角色,Windows需要WSL2而非Docker Desktop。
GPUStack的定价与许可
GPUStack本身是免费的,并以Apache License 2.0许可发布,这一点已通过项目自身的仓库确认——截至本评测撰写时,项目公开网站或官方文档中均未记录GPUStack单独的付费或"企业版"层级。本评测涵盖的每一项功能,包括多后端编排和集群调度,都是同一个开源项目的一部分。
GPUStack与单机运行环境对比
GPUStack常与Ollama、LM Studio等工具进行比较,因为三者都能在本地运行开放模型——但GPUStack解决的是一个不同的问题:在多个GPU和多台机器上扩展推理,而不是在单一设备上运行模型。无论是Ollama还是LM Studio,都不是GPUStack在集群编排方面的真正对等产品;坦率地说,对于不需要集群编排的读者而言,它们是最接近的单机替代方案。
主要目的
- GPUStack:
- GPU集群管理器——在多个GPU和机器上编排推理
- Ollama / LM Studio:
- 单机本地模型运行环境和/或桌面聊天应用
架构
- GPUStack:
- 中央服务器加上一个或多个贡献GPU算力的工作节点
- Ollama / LM Studio:
- 单一设备上的单一进程;没有内置的多机集群功能
后端
- GPUStack:
- 编排llama-box、vLLM、SGLang、TensorRT-LLM、Ascend MindIE或自定义引擎
- Ollama / LM Studio:
- 内置基于llama.cpp的引擎(Ollama);llama.cpp / MLX(LM Studio)
按需GPU实例
- GPUStack:
- 有——在集群内配置可通过SSH访问的实例
- Ollama / LM Studio:
- 没有类似功能
许可证
- GPUStack:
- Apache-2.0
- Ollama / LM Studio:
- MIT(Ollama);免费专有许可(LM Studio)
典型用户
- GPUStack:
- 拥有多个GPU或机器、希望整合用于服务的团队
- Ollama / LM Studio:
- 在一台笔记本电脑或工作站上运行模型的个人
如果您只有一个GPU且没有增加计划,那么GPUStack的集群机制就是不必要的开销——Ollama或LM Studio能在单一设备上更快地让模型运行起来。详情请参阅完整的Ollama评测和LM Studio评测。
谁适合使用GPUStack
GPUStack是否值得采用,几乎完全取决于一个问题:您是否拥有一个以上的GPU或机器需要整合,或者是否计划在不久后增加?
GPUStack与其他本地AI工具对比
GPUStack位于本地LLM软件目录中的运行环境与管理器细分领域,但其多GPU、多机器的集群编排设计,使其区别于该类别中大多数在单一设备上运行的工具。截至本评测发布时,本站没有其他FeatureAppPost评测涵盖GPUStack在多GPU集群方面的真正对等产品——以下最接近的比较对象是单机运行环境,坦率地说,它们解决的是一个不同的问题:在单一设备上运行模型,而不是跨多台设备扩展。
- Ollama ——一款面向单一机器的通用本地模型运行环境,完全采用MIT许可,拥有广泛的模型库。如果您不需要跨多个GPU或机器的集群编排,这是最接近的单机替代方案。请参阅完整的Ollama评测。
- LM Studio ——一款面向单一设备本地推理的GUI优先桌面应用,目标用户是终端用户而非集群管理员。如果您想在一台笔记本电脑上使用精致的聊天应用,它比GPUStack更合适。请参阅完整的LM Studio评测。
- Docker Model Runner ——一项随Docker Desktop/Engine捆绑的CLI与API功能,用于在单一机器上运行模型;如果您的工作负载不需要整合多个GPU,这是另一个可以与GPUStack的集群编排方式进行权衡的单设备选项。请参阅完整的Docker Model Runner评测。
评估GPUStack时常见的误区
关于GPUStack的大多数误解,来自于把它当作单机工具,或者误以为它与其实际编排的推理引擎直接竞争。
常见问题
GPUStack是什么?
GPUStack(github.com/gpustack/gpustack)是一款用于AI模型服务的开源GPU集群管理器——它可以在异构本地硬件上自动配置并编排推理引擎,并能按需配置可通过SSH访问的GPU实例。
GPUStack与Ollama或LM Studio是同一类产品吗?
不是。Ollama和LM Studio在单一机器上运行模型。GPUStack是一款集群管理器,其目的是通过服务器-工作节点架构在多个GPU和多台机器上整合并调度推理。对于不需要集群编排的读者而言,Ollama和LM Studio是最接近的单机替代方案。
GPUStack是开源的吗?
是的。GPUStack以Apache License 2.0许可发布,这一点已通过项目自身的仓库确认。截至本评测撰写时,项目公开网站上未记录GPUStack单独的付费或企业版层级。
GPUStack是免费的吗?
是的,GPUStack本身在Apache-2.0许可下是免费的。运行集群仍然会产生与GPUStack自身许可无关的真实基础设施成本(GPU、机器、网络)。
如何安装GPUStack?
目前推荐的方式是Docker:sudo docker run -d --name gpustack --restart unless-stopped -p 80:80 --volume gpustack-data:/var/lib/gpustack gpustack/gpustack。Kubernetes环境下可使用Helm chart,离线环境有对应的air-gapped安装路径说明。遗留的curl脚本(curl -sfL https://get.gpustack.ai | sh -s -)仍然可用,但自v0.7起已被弃用。
GPUStack支持哪些平台?
GPUStack服务器可通过Docker在Linux、macOS或Windows(Docker Desktop)上运行。作为贡献GPU算力的机器,工作节点仅支持Linux;根据官方文档,macOS无法运行工作节点,Windows在该角色上需要WSL2而非Docker Desktop。
GPUStack编排哪些推理引擎?
llama-box(GPUStack基于llama.cpp/stable-diffusion.cpp自研的实现)、vLLM、SGLang、TensorRT-LLM,以及面向华为Ascend NPU硬件的Ascend MindIE,并支持添加自定义推理引擎。
GPUStack是否提供OpenAI兼容API?
是的,根据官方文档,因此已经基于OpenAI API格式构建的应用程序只需极少改动即可指向由GPUStack管理的端点。
GPUStack的GitHub星标数是多少?
根据本站自有的目录验证,GPUStack的仓库(github.com/gpustack/gpustack)截至2026年9月5日显示为5,607颗星。由于该数字会随时间变化,请直接查看仓库获取当前数字。
