Skip to main content
PromptQuorum
主页/本地LLM进阶/本地推理引擎、运行时与网关对比(2026):运行和部署模型
Overview & Reference

本地推理引擎、运行时与网关对比(2026):运行和部署模型

·阅读约10分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

PromptQuorum目录中的46款本地运行与部署工具分为三类,应分别比较:推理引擎(30款)、运行时与管理器(13款)以及路由器与网关(4款)。 在引擎中,15款在文档中说明支持NVIDIA GPU,17款说明支持Apple Silicon,21款说明提供OpenAI兼容API;在运行时中,6款说明提供OpenAI兼容API。请使用下方的对比表,并在安装前阅读各工具自己的评测。

在自己的硬件上运行模型涉及三类不同的工具——执行模型的推理引擎、帮你下载并运行模型的运行时与管理器,以及位于它们前面的路由器与网关——没有任何单一的功能清单能公平地比较它们。本指南逐类比较46款免费和免费增值(freemium)工具,对比表由与各工具PromptQuorum评测相同的数据生成,因此表格与评测不会互相矛盾。

本页包含指向第三方产品的参考链接。PromptQuorum 未加入任何联盟计划——这些是不产生佣金的普通链接。点击链接和后续步骤由您自行承担责任。这些链接不代表 PromptQuorum 的任何认可或验证。

关键要点

  • 46款工具,三个类别:推理引擎(30款)、运行时与管理器(13款)、路由器与网关(4款)。Ollama同时出现在两个分组中,因为它既是引擎也是运行时。
  • 对比表由各工具的记录生成,并对照其官方README或网站核实;短横线表示“文档中未说明”,绝不表示“没有”。对于一些知名工具,此处引用的文档对某项功能没有提及,因此它们的单元格显示为短横线。
  • 表中的每个工具名称都链接到它自己的PromptQuorum评测,安装步骤和局限都在评测中介绍。

📍 简单一句话

在本地运行模型涉及三类工具——推理引擎、运行时与管理器、路由器与网关——因此PromptQuorum目录中的46款工具按类别分别比较,对比表由与各工具自己的评测相同的工具数据生成。

💬 简单来说

引擎是真正运行模型的部分,运行时或管理器帮你下载并运行模型,网关则在它们之间转发请求。拿引擎和网关比较GPU支持没有意义,所以本指南只比较同类工具。

我们如何比较

每款工具的事实——价格、许可证、平台、硬件需求以及类别专属属性——只在该工具的目录记录中存储一次。下方的对比表由这些记录生成,该工具自己的评测也使用同一条记录,因此两者不会给出不同的数值。

类别专属属性(例如OpenAI兼容API或AMD GPU支持)取自各项目的官方README或网站,并对照其中的确切措辞进行核实。文档没有说明的地方,表中显示短横线而不是猜测;如果某项说法带有限定(实验性、计划中,或仅通过单独的项目提供),该属性不列入表中,而是在该工具的评测中说明。

只有拥有自己PromptQuorum评测的工具才会列入表中。仅作为API服务器列出的工具(h2oGPT、Tabby和OpenAI Edge TTS)在各自的类别中比较。本对比列出的是在你自己的硬件上运行的工具;它不做排名,因为合适的选择取决于你的限制条件。

对比表

请先在下方选择一类工具,然后横向阅读每一行。点击工具名称即可打开其完整的PromptQuorum评测。

工具价格许可证平台运行方式硬件版本兼容OpenAI的APINVIDIA GPUApple SiliconAMD GPUCPU推理多GPU/多节点评测产品链接 · 已披露
candle-vllm免费MITmacOS, Windows, Linux本地因模型而异v0.9.1阅读评测candle-vllm
claude-code-local免费MITmacOS本地因模型而异v0.3.0阅读评测claude-code-local
ExLlamaV2免费MITWindows, Linux本地8 GB显存v0.3.2阅读评测ExLlamaV2
exo免费Apache-2.0macOS, Linux本地因模型而异阅读评测exo
KoboldCpp免费AGPL-3.0Windows, Linux, macOS本地因模型而异v1.121阅读评测KoboldCpp
KServe免费Apache-2.0Linux本地CPU即可v0.20.0阅读评测KServe
llama.cpp免费MITmacOS, Windows, Linux本地因模型而异v0.4.1阅读评测llama.cpp
Llamafile免费Apache-2.0macOS, Windows, Linux本地因模型而异0.10.6阅读评测Llamafile
LMDeploy免费Apache-2.0Linux本地因模型而异v0.17.0阅读评测LMDeploy
LocalAI免费MITmacOS, Windows, Linux本地因模型而异阅读评测LocalAI
LoRAX免费Apache-2.0Linux本地因模型而异v0.12.1阅读评测LoRAX
Lucebox免费Apache-2.0Linux本地因模型而异阅读评测Lucebox
MLC LLM免费Apache-2.0macOS, Windows, Linux, iOS, Android本地因模型而异阅读评测MLC LLM
MLX-LM免费MITmacOS本地因模型而异阅读评测MLX-LM
mlx-serve免费MITmacOS本地因模型而异v26.9.4阅读评测mlx-serve
mlxcel免费Apache-2.0macOS, Linux本地因模型而异v0.7.0阅读评测mlxcel
NVIDIA Dynamo免费Apache-2.0Linux本地因模型而异v1.4–v1.6阅读评测NVIDIA Dynamo
Ollama免费MITmacOS, Windows, Linux本地因模型而异阅读评测Ollama
OlliteRT免费Apache-2.0Android本地CPU即可阅读评测OlliteRT
oMLX免费Apache-2.0macOS本地因模型而异v0.6.4阅读评测oMLX
OpenLLM免费Apache-2.0混合因模型而异阅读评测OpenLLM
Rapid-MLX免费Apache-2.0macOS本地8 GB内存阅读评测Rapid-MLX
SGLang免费Apache-2.0Linux本地因模型而异阅读评测SGLang
Shimmy免费Apache-2.0macOS, Windows, Linux本地因模型而异阅读评测Shimmy
SwiftLM免费MITmacOS, iOS本地因模型而异阅读评测SwiftLM
TensorRT-LLM免费Apache-2.0Windows, Linux本地因模型而异阅读评测TensorRT-LLM
text-generation-webui免费AGPL-3.0Windows, Linux, macOS本地因模型而异阅读评测text-generation-webui
TurboFieldfare免费Apache-2.0macOS本地2 GB内存阅读评测TurboFieldfare
vLLM免费Apache-2.0Linux本地因模型而异阅读评测vLLM
vllm-mlx免费Apache-2.0macOS本地因模型而异阅读评测vllm-mlx

“—”表示该项目自己的文档未说明,并不代表该功能不存在。数值取自各项目的官方README或网站,并在更新该工具评测时重新核对。

推理引擎:差异所在

运行时与管理器:差异所在

  • OpenAI兼容API。Docker Model RunnerFoundry LocalGPUStackJanLemonadeOsaurus在文档中说明提供OpenAI兼容的API。
  • 桌面应用。GPT4AllJanLM StudioOsaurusYpipe在文档中说明提供可安装的桌面应用。
  • 内置模型库。Foundry LocalGPUStackJanLemonadeLM StudioOllama在文档中说明内置了查找和下载模型的方式。
  • 无界面或服务器模式。DreamServerGPUStackLemonadeOsaurus在文档中说明可作为后台服务或不带GUI的服务器运行。
  • 许可证与价格。 这里有四款运行时采用Apache-2.0,四款采用MIT。LM Studio和Docker Model Runner是专有软件(LM Studio可免费使用;Docker Model Runner随Docker Desktop捆绑提供),Msty是闭源软件并提供免费层,RunAnywhere和YPipe使用自己的条款或未公开的条款——请查看各自的评测。

路由器与网关:差异所在

  • OpenAI兼容端点。AIClient2APIlitellm在文档中说明提供OpenAI兼容的端点。
  • 路由到本地模型。litellm在文档中说明其支持的提供商包括本地或自托管模型(例如Ollama)。
  • 故障回退与负载均衡。AIClient2APIClawRouterlitellm在文档中说明支持在模型或提供商之间进行回退、重试或负载均衡。
  • 许可证。 四款中有两款采用MIT,一款采用GPL-3.0,一款采用Apache-2.0。

本对比无法告诉你的内容

  • 它比较的是文档中说明的能力,而不是性能。它不涉及每秒token数、内存占用或延迟——PromptQuorum没有对这些工具测量过这些指标,而且它们在很大程度上取决于你的硬件和模型。
  • 短横线是我们所查文档中的空白,而不是否定的结论。有些工具可能支持其README没有提到的功能;这在少数几款README简短、说明很少的常用工具上最为明显(例如Ollama的引擎功能)。
  • 硬件支持指的是文档中所述内容,并不保证在该硬件上有良好的体验;实际要求请阅读该工具的评测。
  • 工具更新很快。每款工具的评测都会说明核对时所用的版本,本指南会在评测更新时随之刷新。

常见问题

推理引擎、运行时和网关有什么区别?

推理引擎在你的硬件上执行模型(例如llama.cpp或vLLM)。运行时或管理器帮你下载模型并运行它们,通常带有桌面应用或模型库(例如Ollama或LM Studio)。路由器或网关位于一个或多个模型或提供商的前面并转发请求。它们承担不同的工作,因此分别比较。

对比表中的短横线是什么意思?

表示该项目自己的文档没有说明该属性。这并不表示缺少该功能;请查看该工具的评测或其代码仓库。

为什么Ollama出现在两个分组中?

Ollama既是推理引擎,也是管理模型的运行时,因此在两个分组中都有列出。它的README说明的这里所比较的属性很少,所以它的许多单元格显示为短横线。

这些工具中有带联盟链接(affiliate link)的吗?

没有。撰写本文时,PromptQuorum与本对比中的任何工具都没有联盟合作关系,这里的任何链接都不会带来佣金。

这份对比多久更新一次?

每年刷新两次,并且在所列任一工具的评测更新时也会刷新,因为对比表与这些评测由相同的数据生成。

资料来源

← 返回 本地LLM进阶