Skip to main content
PromptQuorum
主页/本地LLM进阶/OpenLLM测评2026:BentoML的可自托管LLM API服务器
Overview & Reference

OpenLLM测评2026:BentoML的可自托管LLM API服务器

·阅读约11分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

OpenLLM是BentoML打造的免费开源(Apache-2.0)推理服务器,让你用一条CLI命令,在OpenAI兼容API背后运行Llama、DeepSeek、Qwen等开源权重大模型。 它通过pip install openllm安装,完全运行在你自己掌控的硬件上;openllm deploy命令提供一条可选路径,接入BentoML单独付费的托管云产品BentoCloud,实现自动扩缩容托管——但开源服务器本身完全可自托管且免费。

OpenLLM(github.com/bentoml/OpenLLM)是BentoML推出的免费开源推理服务器,采用Apache-2.0许可证,能用一条CLI命令将Llama、DeepSeek、Qwen等开源权重模型部署为OpenAI兼容API。与可下载的桌面应用不同,OpenLLM是一个通过终端安装和运行的Python包——完全可自托管,同时提供一条可选路径,接入BentoML的付费托管云产品BentoCloud,用于自动扩缩容托管而非自行运维服务器。本文介绍OpenLLM的实际功能、安装方式、真实特性集,以及与vLLM等其他推理服务工具的对比。

关键要点

  • OpenLLM(github.com/bentoml/OpenLLM)是采用Apache-2.0许可证的免费开源推理服务器,不是可下载的桌面应用
  • BentoML开发和维护;仓库创建于2023年4月19日
  • 通过pip install openllm安装;快速上手可运行openllm hello
  • 据官方README介绍,在OpenAI兼容API背后提供15+个开源权重模型系列——Llama、DeepSeek、Qwen2.5、Mistral、Gemma、Phi等
  • 可将vLLM作为推理后端,并在/chat端点内置聊天界面
  • 模型名称通过配套仓库bentoml/openllm-models解析,并支持自定义仓库
  • openllm deploy提供一条可选、单独付费的路径,接入BentoML的托管云产品BentoCloud——并非使用OpenLLM的必要条件
  • 截至2026年9月,GitHub仓库约有12,535颗星和842次分叉

📍 简单一句话

OpenLLM是BentoML推出的免费开源(Apache-2.0)推理服务器,能在OpenAI兼容API背后运行Llama、DeepSeek、Qwen等开源权重大模型,通过pip install openllm安装,并提供一条可选付费路径接入BentoML的托管BentoCloud服务。

💬 简单来说

OpenLLM是命令行工具,不是下载后点击打开的应用——你用pip命令安装它,然后运行一条命令启动本地服务器,其他程序(或你自己)就能用和OpenAI API相同的请求格式与之通信。除非你主动选择部署到BentoML单独付费的云产品BentoCloud,否则一切都运行在你自己的机器上。

📌: 本文是本地大模型软件目录中OpenLLM条目的深度补充版——想快速了解OpenLLM与其他数十款本地AI工具的对比,请参阅该页面。

OpenLLM是什么?

OpenLLM是一个基于Python的推理服务器,能用一条命令将开源权重大模型转换为OpenAI兼容的API端点,由BentoML开发和维护。 它在GitHub上的官方描述直言不讳:"Run any open-source LLMs, such as DeepSeek and Llama, as OpenAI compatible API endpoint in the cloud."(将DeepSeek、Llama等任意开源大模型运行为OpenAI兼容的API端点,可部署在云端。)尽管这句标语中提到"in the cloud",但服务器本身可以运行在任何能运行Python的地方——笔记本电脑、本地GPU机器,或你自己掌控的云虚拟机;自托管是默认使用方式,而非附加选项。

  • 产品类型:CLI工具和Python库,不是面向终端用户的可下载应用——通过pip install openllm安装
  • 开发方:BentoML,该公司同时开发BentoML模型服务框架和托管产品BentoCloud
  • 仓库地址:github.com/bentoml/OpenLLM,创建于2023年4月19日
  • 许可证:Apache-2.0,已通过仓库的许可证元数据确认
  • 规模:截至2026年9月,约有12,535颗GitHub星标和842次分叉
  • 配套项目:bentoml/openllm-models,一个存放模型仓库定义的独立仓库,供OpenLLM的CLI读取

OpenLLM的项目历史与版本里程碑

OpenLLM的GitHub仓库创建于2023年4月19日,项目在2024年年中经历了一次官方自称为破坏性变更的重大重写,将其定位从高度可定制的服务工具包转向更简单、以云部署为优先的CLI工具——也就是它今天的形态。

  1. 1
    v0.1.0——2023年6月12日:首个正式版本标签
    Why it matters: 这一阶段的CLI以`openllm start <model-name>`为核心,这是一种较旧的命令语法,此后已被`openllm serve`和`openllm run`取代。
  2. 2
    v0.5.0——2024年5月27日:重写前的架构
    Why it matters: 据官方发布历史记录,这是OpenLLM最大结构性变革之前的最后一个次要版本。
  3. 3
    v0.6.0——2024年7月11日:官方宣布的破坏性重写
    Why it matters: OpenLLM自己的发布说明将这个版本描述为"a significant shift in our project's philosophy"(我们项目理念的重大转变)——从维护者所说的因过度定制而导致范围蔓延的部署方式,转向更简单、以云部署为中心的工具。当前的CLI(`openllm serve`、`openllm deploy`)正是建立在这一架构之上。
  4. 4
    配套仓库openllm-models创建——2024年5月18日
    Why it matters: BentoML将模型定义拆分到独立仓库([bentoml/openllm-models](https://github.com/bentoml/openllm-models)),OpenLLM的CLI依赖它来解析`llama3.2:1b`这样的模型名称,该仓库也支持自定义的自托管仓库。
  5. 5
    v0.6.30——2025年4月21日:最新的正式版本标签
    Why it matters: 截至本文撰写时,[PyPI](https://pypi.org/project/openllm/)上列出的最新版本。

OpenLLM能做什么?

OpenLLM的核心功能是将所选的开源权重模型转变为可运行的OpenAI兼容API服务器,并在此之上叠加一层针对模型、仓库和云部署的管理能力。以下是根据OpenLLM官方GitHub README整理的各项功能说明。

  • OpenAI兼容API——OpenLLM提供的每个模型都可通过与OpenAI API相同的请求/响应格式访问,因此现有的OpenAI客户端代码可以直接指向OpenLLM
  • 内置聊天界面——本地服务器(默认地址http://localhost:3000)的/chat端点提供基于网页的聊天界面,无需编写任何客户端代码即可测试模型
  • 广泛的模型支持——据官方README介绍,支持15+个开源权重模型系列,包括Llama(3.1、3.2、3.3、4)、Mistral(8B和Large 123B)、Qwen(2.5和2.5-Coder)、Gemma(2和3)、Phi(4)、DeepSeek(R1)、Pixtral、Jamba和QwQ
  • vLLM推理后端——据官方文档介绍,OpenLLM集成了vLLM作为可用的推理后端之一,而非只提供从零构建的自研推理实现
  • 模型仓库系统——CLI默认对照bentoml/openllm-models解析模型名称,并支持通过openllm repo update使用自定义的自托管模型仓库
  • CLI模型管理——openllm model listopenllm model get <name>可在不离开终端的情况下查看可用模型及其详情
  • Docker和Kubernetes部署——除BentoCloud选项外,OpenLLM官方文档还涵盖了用于自托管的容器化和Kubernetes部署路径
  • 可选的BentoCloud部署——openllm deploy <model> --env HF_TOKEN可将模型推送到BentoCloud,即BentoML单独付费的托管产品,用于自动扩缩容的生产环境托管

使用示例:OpenLLM的三种使用方式

以下是根据上述OpenLLM官方CLI命令整理的具体工作流程,而非假设性的使用场景。

安装OpenLLM

OpenLLM可通过pip免费安装,源代码托管在GitHub上。 作为CLI工具和Python库——而非面向终端用户的可下载应用——它没有按操作系统区分的安装程序;下表列出了安装命令和参考链接,采用本站针对框架/CLI类主题的通用模式。

安装命令(pip)

链接:
pip install openllm

快速上手命令

链接:
openllm hello

GitHub仓库(源代码,Apache-2.0)

PyPI软件包

模型仓库(bentoml/openllm-models)

官方文档与BentoCloud

OpenLLM需要终端和Python环境(通过pip安装)——没有图形化安装程序。Hugging Face上的受限模型下载需要设置环境变量HF_TOKEN

OpenLLM是免费的吗?OpenLLM与BentoCloud定价对比

是的——OpenLLM软件本身是免费的。 它采用Apache-2.0许可证,没有自己的付费层级,也不设任何使用限制;GitHub仓库公开可见,通过pip安装无需注册账号。

  • OpenLLM开源项目本身不设订阅、不设付费层级、不设使用限制
  • 在本地安装或运行OpenLLM无需账号或注册
  • 在你自己的硬件(笔记本电脑、本地GPU服务器,或你自行管理的云虚拟机)上运行OpenLLM,只需支付该硬件或云计算资源本身的费用
  • BentoML另一款独立的托管产品BentoCloud是收费的——其营销官网未公布自助式定价数字,而是引导潜在客户预约演示;因此具体的BentoCloud费用请直接向BentoML确认,而非依赖第三方估算
  • 是否选择BentoCloud是可选的:只有openllm deploy命令会涉及它,OpenLLM的其他命令(serverunmodel list)都完全运行在你自己掌控的基础设施上

OpenLLM vs. vLLM

OpenLLM和vLLM经常被相提并论,但二者处于同一技术栈的不同层级——OpenLLM可以将vLLM作为自己的推理后端,而不是二者单纯互为替代品。 vLLM是专注于服务速度和内存效率的高吞吐推理引擎/库;OpenLLM则是一个更高层的服务框架,将某个推理后端(vLLM是其中之一)包装在模型管理、OpenAI兼容API、内置聊天界面以及可选的托管云部署路径之中。

主要定位

OpenLLM:
更高层的服务框架:模型管理+OpenAI API+可选云部署
vLLM:
高吞吐推理引擎/库,可独立使用,也可嵌入其他服务器

推理后端

OpenLLM:
据官方文档介绍,将vLLM集成为可用后端之一
vLLM:
本身就是推理引擎,围绕PagedAttention内存管理构建

CLI模型管理

OpenLLM:
openllm model listopenllm repo update,支持模型名称简写
vLLM:
主要是一条服务命令(vllm serve <model>),内置目录管理工具较少

内置聊天界面

OpenLLM:
有,位于/chat端点
vLLM:
没有内置聊天界面,通常需要搭配独立前端使用

托管云路径

OpenLLM:
可选的openllm deploy可接入BentoCloud(BentoML,付费)
vLLM:
没有自己的官方托管云产品

维护方

OpenLLM:
BentoML
vLLM:
vLLM开源项目——详情参见vLLM解读文章

如果你最看重的是作为自有技术栈构建模块的原始推理吞吐速度,请直接评估vLLM。如果你更看重带有模型管理和可选托管云部署路径的更高层OpenAI兼容服务器,OpenLLM的功能集更为全面——而且二者并非互斥,因为OpenLLM可以将vLLM作为其后端来运行。

OpenLLM适合谁使用?

OpenLLM是否适合你,取决于你是否想要一个免费、可自托管、OpenAI兼容的服务层,并保留一条可选的托管云退路,而不是一个单纯的推理库或可下载的聊天应用。

竞品与替代方案

OpenLLM是众多将开源权重模型推理封装在OpenAI兼容API背后的工具之一。以下是它在推理服务器这一细分领域与其他选项的对比——完整目录请参阅本地大模型软件目录,最直接的对比请参阅上文专门的OpenLLM vs. vLLM对比

  • vLLM——OpenLLM可作为后端使用的高吞吐推理引擎;如果原始服务吞吐是你的主要关切,值得直接评估。详见上方专门的对比部分。
  • SGLang——另一款高性能推理引擎兼服务框架,常在吞吐量和结构化生成功能方面与vLLM对比。
  • LocalAI——一款免费开源、OpenAI兼容的本地推理服务器,更侧重于在同一API背后运行多种模型类型(文本、图像、音频)。
  • LiteLLM——一个代理/SDK,能在众多不同的大模型提供商和自托管后端(包括OpenLLM本身)之上提供统一的OpenAI兼容接口。

评估OpenLLM时的常见误区

围绕OpenLLM的大多数误解,都来自它与BentoCloud的关系、它与vLLM的关系,或是误以为最新的正式版本标签就代表最新代码。

常见问题

OpenLLM是什么?

OpenLLM(github.com/bentoml/OpenLLM)是BentoML推出的免费开源推理服务器,采用Apache-2.0许可证,能用一条CLI命令将开源权重大模型转换为OpenAI兼容的API端点。

OpenLLM是免费的吗?

是的。OpenLLM软件免费开源,没有自己的付费层级。BentoML另一款独立的托管产品BentoCloud是收费的,但使用它是可选的——OpenLLM的每条核心命令都运行在你自己掌控的基础设施上。

OpenLLM采用什么许可证?

Apache-2.0,已通过GitHub仓库的许可证元数据确认。

OpenLLM需要BentoCloud吗?

不需要。openllm serveopenllm runopenllm model list都完全运行在你自己的硬件上。只有运行openllm deploy时才会涉及BentoCloud,这是一条可选、单独付费的部署路径。

OpenLLM支持哪些模型?

据官方README介绍,OpenLLM支持15+个开源权重模型系列,包括Llama(3.1、3.2、3.3、4)、Mistral(8B和Large 123B)、Qwen(2.5和2.5-Coder)、Gemma(2和3)、Phi(4)、DeepSeek(R1)、Pixtral、Jamba和QwQ,这些模型通过配套仓库openllm-models解析。

如何安装OpenLLM?

运行pip install openllm,然后可以运行openllm hello快速交互式上手,或运行openllm serve <model-name>启动本地OpenAI兼容服务器。

OpenLLM使用vLLM吗?

可以使用。据官方文档介绍,OpenLLM将vLLM集成为可用的推理后端之一,而非只提供从零构建的自研推理实现。

OpenLLM和vLLM有什么区别?

vLLM是高吞吐推理引擎/库;OpenLLM是更高层的服务框架,将某个推理后端(vLLM是其中之一)包装在模型管理、OpenAI兼容API、内置聊天界面和可选的托管云部署路径之中。详见上方专门的OpenLLM vs. vLLM对比

OpenLLM由谁开发?

BentoML,该公司同时开发BentoML模型服务框架和托管产品BentoCloud。托管OpenLLM代码的GitHub组织是bentoml

OpenLLM还在积极维护吗?

该仓库创建于2023年4月19日,据GitHub API显示最近一次推送发生在2026年9月14日,表明开发仍在持续。其最新的正式版本标签是v0.6.30(2025年4月21日)——本文指出了这一差距,请直接在GitHub或PyPI上核实当前发布状态。

参考来源

← 返回 本地LLM进阶