关键要点
- 46款工具,三个类别:推理引擎(30款)、运行时与管理器(13款)、路由器与网关(4款)。Ollama同时出现在两个分组中,因为它既是引擎也是运行时。
- 对比表由各工具的记录生成,并对照其官方README或网站核实;短横线表示“文档中未说明”,绝不表示“没有”。对于一些知名工具,此处引用的文档对某项功能没有提及,因此它们的单元格显示为短横线。
- 表中的每个工具名称都链接到它自己的PromptQuorum评测,安装步骤和局限都在评测中介绍。
📍 简单一句话
在本地运行模型涉及三类工具——推理引擎、运行时与管理器、路由器与网关——因此PromptQuorum目录中的46款工具按类别分别比较,对比表由与各工具自己的评测相同的工具数据生成。
💬 简单来说
引擎是真正运行模型的部分,运行时或管理器帮你下载并运行模型,网关则在它们之间转发请求。拿引擎和网关比较GPU支持没有意义,所以本指南只比较同类工具。
我们如何比较
每款工具的事实——价格、许可证、平台、硬件需求以及类别专属属性——只在该工具的目录记录中存储一次。下方的对比表由这些记录生成,该工具自己的评测也使用同一条记录,因此两者不会给出不同的数值。
类别专属属性(例如OpenAI兼容API或AMD GPU支持)取自各项目的官方README或网站,并对照其中的确切措辞进行核实。文档没有说明的地方,表中显示短横线而不是猜测;如果某项说法带有限定(实验性、计划中,或仅通过单独的项目提供),该属性不列入表中,而是在该工具的评测中说明。
只有拥有自己PromptQuorum评测的工具才会列入表中。仅作为API服务器列出的工具(h2oGPT、Tabby和OpenAI Edge TTS)在各自的类别中比较。本对比列出的是在你自己的硬件上运行的工具;它不做排名,因为合适的选择取决于你的限制条件。
对比表
请先在下方选择一类工具,然后横向阅读每一行。点击工具名称即可打开其完整的PromptQuorum评测。
| 工具 | 价格 | 许可证 | 平台 | 运行方式 | 硬件 | 版本 | 兼容OpenAI的API | NVIDIA GPU | Apple Silicon | AMD GPU | CPU推理 | 多GPU/多节点 | 评测 | 产品链接 · 已披露 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| candle-vllm | 免费 | MIT | macOS, Windows, Linux | 本地 | 因模型而异 | v0.9.1 | 是 | 是 | 是 | — | — | 是 | 阅读评测 → | candle-vllm |
| claude-code-local | 免费 | MIT | macOS | 本地 | 因模型而异 | v0.3.0 | — | — | 是 | — | — | — | 阅读评测 → | claude-code-local |
| ExLlamaV2 | 免费 | MIT | Windows, Linux | 本地 | 8 GB显存 | v0.3.2 | — | 是 | — | — | — | 是 | 阅读评测 → | ExLlamaV2 |
| exo | 免费 | Apache-2.0 | macOS, Linux | 本地 | 因模型而异 | — | 是 | — | 是 | — | 是 | 是 | 阅读评测 → | exo |
| KoboldCpp | 免费 | AGPL-3.0 | Windows, Linux, macOS | 本地 | 因模型而异 | v1.121 | 是 | 是 | 是 | 是 | 是 | — | 阅读评测 → | KoboldCpp |
| KServe | 免费 | Apache-2.0 | Linux | 本地 | CPU即可 | v0.20.0 | 是 | — | — | — | — | 是 | 阅读评测 → | KServe |
| llama.cpp | 免费 | MIT | macOS, Windows, Linux | 本地 | 因模型而异 | v0.4.1 | 是 | 是 | 是 | 是 | 是 | — | 阅读评测 → | llama.cpp |
| Llamafile | 免费 | Apache-2.0 | macOS, Windows, Linux | 本地 | 因模型而异 | 0.10.6 | — | — | — | — | — | — | 阅读评测 → | Llamafile |
| LMDeploy | 免费 | Apache-2.0 | Linux | 本地 | 因模型而异 | v0.17.0 | — | 是 | — | — | — | 是 | 阅读评测 → | LMDeploy |
| LocalAI | 免费 | MIT | macOS, Windows, Linux | 本地 | 因模型而异 | — | 是 | 是 | 是 | 是 | 是 | 是 | 阅读评测 → | LocalAI |
| LoRAX | 免费 | Apache-2.0 | Linux | 本地 | 因模型而异 | v0.12.1 | 是 | 是 | — | — | — | 是 | 阅读评测 → | LoRAX |
| Lucebox | 免费 | Apache-2.0 | Linux | 本地 | 因模型而异 | — | 是 | 是 | — | 是 | — | 是 | 阅读评测 → | Lucebox |
| MLC LLM | 免费 | Apache-2.0 | macOS, Windows, Linux, iOS, Android | 本地 | 因模型而异 | — | 是 | 是 | 是 | 是 | — | — | 阅读评测 → | MLC LLM |
| MLX-LM | 免费 | MIT | macOS | 本地 | 因模型而异 | — | — | — | 是 | — | — | 是 | 阅读评测 → | MLX-LM |
| mlx-serve | 免费 | MIT | macOS | 本地 | 因模型而异 | v26.9.4 | 是 | — | 是 | — | — | — | 阅读评测 → | mlx-serve |
| mlxcel | 免费 | Apache-2.0 | macOS, Linux | 本地 | 因模型而异 | v0.7.0 | 是 | 是 | 是 | — | — | 是 | 阅读评测 → | mlxcel |
| NVIDIA Dynamo | 免费 | Apache-2.0 | Linux | 本地 | 因模型而异 | v1.4–v1.6 | 是 | — | — | — | — | 是 | 阅读评测 → | NVIDIA Dynamo |
| Ollama | 免费 | MIT | macOS, Windows, Linux | 本地 | 因模型而异 | — | — | — | — | — | — | — | 阅读评测 → | Ollama |
| OlliteRT | 免费 | Apache-2.0 | Android | 本地 | CPU即可 | — | 是 | — | — | — | 是 | — | 阅读评测 → | OlliteRT |
| oMLX | 免费 | Apache-2.0 | macOS | 本地 | 因模型而异 | v0.6.4 | 是 | — | 是 | — | — | 是 | 阅读评测 → | oMLX |
| OpenLLM | 免费 | Apache-2.0 | — | 混合 | 因模型而异 | — | 是 | — | — | — | — | — | 阅读评测 → | OpenLLM |
| Rapid-MLX | 免费 | Apache-2.0 | macOS | 本地 | 8 GB内存 | — | 是 | — | 是 | — | — | — | 阅读评测 → | Rapid-MLX |
| SGLang | 免费 | Apache-2.0 | Linux | 本地 | 因模型而异 | — | — | 是 | — | 是 | 是 | 是 | 阅读评测 → | SGLang |
| Shimmy | 免费 | Apache-2.0 | macOS, Windows, Linux | 本地 | 因模型而异 | — | 是 | 是 | 是 | 是 | — | — | 阅读评测 → | Shimmy |
| SwiftLM | 免费 | MIT | macOS, iOS | 本地 | 因模型而异 | — | 是 | — | 是 | — | — | — | 阅读评测 → | SwiftLM |
| TensorRT-LLM | 免费 | Apache-2.0 | Windows, Linux | 本地 | 因模型而异 | — | — | 是 | — | — | — | — | 阅读评测 → | TensorRT-LLM |
| text-generation-webui | 免费 | AGPL-3.0 | Windows, Linux, macOS | 本地 | 因模型而异 | — | 是 | 是 | 是 | 是 | 是 | — | 阅读评测 → | text-generation-webui |
| TurboFieldfare | 免费 | Apache-2.0 | macOS | 本地 | 2 GB内存 | — | — | — | 是 | — | — | — | 阅读评测 → | TurboFieldfare |
| vLLM | 免费 | Apache-2.0 | Linux | 本地 | 因模型而异 | — | 是 | 是 | — | 是 | 是 | 是 | 阅读评测 → | vLLM |
| vllm-mlx | 免费 | Apache-2.0 | macOS | 本地 | 因模型而异 | — | 是 | — | 是 | — | — | — | 阅读评测 → | vllm-mlx |
“—”表示该项目自己的文档未说明,并不代表该功能不存在。数值取自各项目的官方README或网站,并在更新该工具评测时重新核对。
推理引擎:差异所在
- OpenAI兼容API。candle-vllm、NVIDIA Dynamo、exo、KoboldCpp、KServe、llama.cpp、LocalAI、LoRAX、Lucebox、MLC LLM、mlx-serve、mlxcel、OlliteRT、oMLX、OpenLLM、Rapid-MLX、Shimmy、SwiftLM、text-generation-webui、vllm-mlx和vLLM在文档中说明提供OpenAI兼容的HTTP API,因此为OpenAI API编写的应用可以直接指向它们。
- NVIDIA GPU。candle-vllm、ExLlamaV2、KoboldCpp、llama.cpp、LMDeploy、LocalAI、LoRAX、Lucebox、MLC LLM、mlxcel、SGLang、Shimmy、TensorRT-LLM、text-generation-webui和vLLM在文档中说明支持NVIDIA GPU(CUDA)。
- Apple Silicon。candle-vllm、claude-code-local、exo、KoboldCpp、llama.cpp、LocalAI、MLC LLM、MLX-LM、mlx-serve、mlxcel、oMLX、Rapid-MLX、Shimmy、SwiftLM、text-generation-webui、TurboFieldfare和vllm-mlx在文档中说明支持Apple Silicon、Metal或MLX。
- AMD GPU。KoboldCpp、llama.cpp、LocalAI、Lucebox、MLC LLM、SGLang、Shimmy、text-generation-webui和vLLM在文档中说明支持AMD GPU。
- CPU推理。exo、KoboldCpp、llama.cpp、LocalAI、OlliteRT、SGLang、text-generation-webui和vLLM在文档中说明支持在CPU上运行推理。
- 多GPU与多节点。candle-vllm、NVIDIA Dynamo、ExLlamaV2、exo、KServe、LMDeploy、LocalAI、LoRAX、Lucebox、MLX-LM、mlxcel、oMLX、SGLang和vLLM在文档中说明支持多GPU、张量并行或多节点推理。
- 许可证。 这里的大多数引擎采用Apache-2.0(19款)或MIT(9款);KoboldCpp和text-generation-webui采用AGPL-3.0。Copyleft许可证会对分发修改后的版本附加条件——参见AI工具许可证详解。
运行时与管理器:差异所在
- OpenAI兼容API。Docker Model Runner、Foundry Local、GPUStack、Jan、Lemonade和Osaurus在文档中说明提供OpenAI兼容的API。
- 桌面应用。GPT4All、Jan、LM Studio、Osaurus和Ypipe在文档中说明提供可安装的桌面应用。
- 内置模型库。Foundry Local、GPUStack、Jan、Lemonade、LM Studio和Ollama在文档中说明内置了查找和下载模型的方式。
- 无界面或服务器模式。DreamServer、GPUStack、Lemonade和Osaurus在文档中说明可作为后台服务或不带GUI的服务器运行。
- 许可证与价格。 这里有四款运行时采用Apache-2.0,四款采用MIT。LM Studio和Docker Model Runner是专有软件(LM Studio可免费使用;Docker Model Runner随Docker Desktop捆绑提供),Msty是闭源软件并提供免费层,RunAnywhere和YPipe使用自己的条款或未公开的条款——请查看各自的评测。
路由器与网关:差异所在
- OpenAI兼容端点。AIClient2API和litellm在文档中说明提供OpenAI兼容的端点。
- 路由到本地模型。litellm在文档中说明其支持的提供商包括本地或自托管模型(例如Ollama)。
- 故障回退与负载均衡。AIClient2API、ClawRouter和litellm在文档中说明支持在模型或提供商之间进行回退、重试或负载均衡。
- 许可证。 四款中有两款采用MIT,一款采用GPL-3.0,一款采用Apache-2.0。
本对比无法告诉你的内容
- 它比较的是文档中说明的能力,而不是性能。它不涉及每秒token数、内存占用或延迟——PromptQuorum没有对这些工具测量过这些指标,而且它们在很大程度上取决于你的硬件和模型。
- 短横线是我们所查文档中的空白,而不是否定的结论。有些工具可能支持其README没有提到的功能;这在少数几款README简短、说明很少的常用工具上最为明显(例如Ollama的引擎功能)。
- 硬件支持指的是文档中所述内容,并不保证在该硬件上有良好的体验;实际要求请阅读该工具的评测。
- 工具更新很快。每款工具的评测都会说明核对时所用的版本,本指南会在评测更新时随之刷新。
常见问题
推理引擎、运行时和网关有什么区别?
推理引擎在你的硬件上执行模型(例如llama.cpp或vLLM)。运行时或管理器帮你下载模型并运行它们,通常带有桌面应用或模型库(例如Ollama或LM Studio)。路由器或网关位于一个或多个模型或提供商的前面并转发请求。它们承担不同的工作,因此分别比较。
对比表中的短横线是什么意思?
表示该项目自己的文档没有说明该属性。这并不表示缺少该功能;请查看该工具的评测或其代码仓库。
为什么Ollama出现在两个分组中?
Ollama既是推理引擎,也是管理模型的运行时,因此在两个分组中都有列出。它的README说明的这里所比较的属性很少,所以它的许多单元格显示为短横线。
这些工具中有带联盟链接(affiliate link)的吗?
没有。撰写本文时,PromptQuorum与本对比中的任何工具都没有联盟合作关系,这里的任何链接都不会带来佣金。
这份对比多久更新一次?
每年刷新两次,并且在所列任一工具的评测更新时也会刷新,因为对比表与这些评测由相同的数据生成。
资料来源
- 各工具的官方README或网站,列在该工具的PromptQuorum评测中(可从对比表链接进入)。
- PromptQuorum本地AI应用目录——对比表每一行所依据的记录。
- AI工具许可证详解——上文提到的各类许可证的含义。