关键要点
- OpenLLM(github.com/bentoml/OpenLLM)是采用Apache-2.0许可证的免费开源推理服务器,不是可下载的桌面应用
- 由BentoML开发和维护;仓库创建于2023年4月19日
- 通过
pip install openllm安装;快速上手可运行openllm hello - 据官方README介绍,在OpenAI兼容API背后提供15+个开源权重模型系列——Llama、DeepSeek、Qwen2.5、Mistral、Gemma、Phi等
- 可将vLLM作为推理后端,并在
/chat端点内置聊天界面 - 模型名称通过配套仓库bentoml/openllm-models解析,并支持自定义仓库
openllm deploy提供一条可选、单独付费的路径,接入BentoML的托管云产品BentoCloud——并非使用OpenLLM的必要条件- 截至2026年9月,GitHub仓库约有12,535颗星和842次分叉
📍 简单一句话
OpenLLM是BentoML推出的免费开源(Apache-2.0)推理服务器,能在OpenAI兼容API背后运行Llama、DeepSeek、Qwen等开源权重大模型,通过pip install openllm安装,并提供一条可选付费路径接入BentoML的托管BentoCloud服务。
💬 简单来说
OpenLLM是命令行工具,不是下载后点击打开的应用——你用pip命令安装它,然后运行一条命令启动本地服务器,其他程序(或你自己)就能用和OpenAI API相同的请求格式与之通信。除非你主动选择部署到BentoML单独付费的云产品BentoCloud,否则一切都运行在你自己的机器上。
📌注: 本文是本地大模型软件目录中OpenLLM条目的深度补充版——想快速了解OpenLLM与其他数十款本地AI工具的对比,请参阅该页面。
OpenLLM是什么?
OpenLLM是一个基于Python的推理服务器,能用一条命令将开源权重大模型转换为OpenAI兼容的API端点,由BentoML开发和维护。 它在GitHub上的官方描述直言不讳:"Run any open-source LLMs, such as DeepSeek and Llama, as OpenAI compatible API endpoint in the cloud."(将DeepSeek、Llama等任意开源大模型运行为OpenAI兼容的API端点,可部署在云端。)尽管这句标语中提到"in the cloud",但服务器本身可以运行在任何能运行Python的地方——笔记本电脑、本地GPU机器,或你自己掌控的云虚拟机;自托管是默认使用方式,而非附加选项。
- 产品类型:CLI工具和Python库,不是面向终端用户的可下载应用——通过
pip install openllm安装 - 开发方:BentoML,该公司同时开发BentoML模型服务框架和托管产品BentoCloud
- 仓库地址:github.com/bentoml/OpenLLM,创建于2023年4月19日
- 许可证:Apache-2.0,已通过仓库的许可证元数据确认
- 规模:截至2026年9月,约有12,535颗GitHub星标和842次分叉
- 配套项目:bentoml/openllm-models,一个存放模型仓库定义的独立仓库,供OpenLLM的CLI读取
OpenLLM的项目历史与版本里程碑
OpenLLM的GitHub仓库创建于2023年4月19日,项目在2024年年中经历了一次官方自称为破坏性变更的重大重写,将其定位从高度可定制的服务工具包转向更简单、以云部署为优先的CLI工具——也就是它今天的形态。
- 1v0.1.0——2023年6月12日:首个正式版本标签
Why it matters: 这一阶段的CLI以`openllm start <model-name>`为核心,这是一种较旧的命令语法,此后已被`openllm serve`和`openllm run`取代。 - 2v0.5.0——2024年5月27日:重写前的架构
Why it matters: 据官方发布历史记录,这是OpenLLM最大结构性变革之前的最后一个次要版本。 - 3v0.6.0——2024年7月11日:官方宣布的破坏性重写
Why it matters: OpenLLM自己的发布说明将这个版本描述为"a significant shift in our project's philosophy"(我们项目理念的重大转变)——从维护者所说的因过度定制而导致范围蔓延的部署方式,转向更简单、以云部署为中心的工具。当前的CLI(`openllm serve`、`openllm deploy`)正是建立在这一架构之上。 - 4配套仓库openllm-models创建——2024年5月18日
Why it matters: BentoML将模型定义拆分到独立仓库([bentoml/openllm-models](https://github.com/bentoml/openllm-models)),OpenLLM的CLI依赖它来解析`llama3.2:1b`这样的模型名称,该仓库也支持自定义的自托管仓库。 - 5v0.6.30——2025年4月21日:最新的正式版本标签
Why it matters: 截至本文撰写时,[PyPI](https://pypi.org/project/openllm/)上列出的最新版本。
OpenLLM能做什么?
OpenLLM的核心功能是将所选的开源权重模型转变为可运行的OpenAI兼容API服务器,并在此之上叠加一层针对模型、仓库和云部署的管理能力。以下是根据OpenLLM官方GitHub README整理的各项功能说明。
- OpenAI兼容API——OpenLLM提供的每个模型都可通过与OpenAI API相同的请求/响应格式访问,因此现有的OpenAI客户端代码可以直接指向OpenLLM
- 内置聊天界面——本地服务器(默认地址
http://localhost:3000)的/chat端点提供基于网页的聊天界面,无需编写任何客户端代码即可测试模型 - 广泛的模型支持——据官方README介绍,支持15+个开源权重模型系列,包括Llama(3.1、3.2、3.3、4)、Mistral(8B和Large 123B)、Qwen(2.5和2.5-Coder)、Gemma(2和3)、Phi(4)、DeepSeek(R1)、Pixtral、Jamba和QwQ
- vLLM推理后端——据官方文档介绍,OpenLLM集成了vLLM作为可用的推理后端之一,而非只提供从零构建的自研推理实现
- 模型仓库系统——CLI默认对照bentoml/openllm-models解析模型名称,并支持通过
openllm repo update使用自定义的自托管模型仓库 - CLI模型管理——
openllm model list和openllm model get <name>可在不离开终端的情况下查看可用模型及其详情 - Docker和Kubernetes部署——除BentoCloud选项外,OpenLLM官方文档还涵盖了用于自托管的容器化和Kubernetes部署路径
- 可选的BentoCloud部署——
openllm deploy <model> --env HF_TOKEN可将模型推送到BentoCloud,即BentoML单独付费的托管产品,用于自动扩缩容的生产环境托管
使用示例:OpenLLM的三种使用方式
以下是根据上述OpenLLM官方CLI命令整理的具体工作流程,而非假设性的使用场景。
安装OpenLLM
OpenLLM可通过pip免费安装,源代码托管在GitHub上。 作为CLI工具和Python库——而非面向终端用户的可下载应用——它没有按操作系统区分的安装程序;下表列出了安装命令和参考链接,采用本站针对框架/CLI类主题的通用模式。
安装命令(pip)
- 链接:
pip install openllm
快速上手命令
- 链接:
openllm hello
GitHub仓库(源代码,Apache-2.0)
PyPI软件包
模型仓库(bentoml/openllm-models)
官方文档与BentoCloud
- 链接:
- bentoml.com
OpenLLM需要终端和Python环境(通过pip安装)——没有图形化安装程序。Hugging Face上的受限模型下载需要设置环境变量HF_TOKEN。
OpenLLM是免费的吗?OpenLLM与BentoCloud定价对比
是的——OpenLLM软件本身是免费的。 它采用Apache-2.0许可证,没有自己的付费层级,也不设任何使用限制;GitHub仓库公开可见,通过pip安装无需注册账号。
- OpenLLM开源项目本身不设订阅、不设付费层级、不设使用限制
- 在本地安装或运行OpenLLM无需账号或注册
- 在你自己的硬件(笔记本电脑、本地GPU服务器,或你自行管理的云虚拟机)上运行OpenLLM,只需支付该硬件或云计算资源本身的费用
- BentoML另一款独立的托管产品BentoCloud是收费的——其营销官网未公布自助式定价数字,而是引导潜在客户预约演示;因此具体的BentoCloud费用请直接向BentoML确认,而非依赖第三方估算
- 是否选择BentoCloud是可选的:只有
openllm deploy命令会涉及它,OpenLLM的其他命令(serve、run、model list)都完全运行在你自己掌控的基础设施上
OpenLLM vs. vLLM
OpenLLM和vLLM经常被相提并论,但二者处于同一技术栈的不同层级——OpenLLM可以将vLLM作为自己的推理后端,而不是二者单纯互为替代品。 vLLM是专注于服务速度和内存效率的高吞吐推理引擎/库;OpenLLM则是一个更高层的服务框架,将某个推理后端(vLLM是其中之一)包装在模型管理、OpenAI兼容API、内置聊天界面以及可选的托管云部署路径之中。
主要定位
- OpenLLM:
- 更高层的服务框架:模型管理+OpenAI API+可选云部署
- vLLM:
- 高吞吐推理引擎/库,可独立使用,也可嵌入其他服务器
推理后端
- OpenLLM:
- 据官方文档介绍,将vLLM集成为可用后端之一
- vLLM:
- 本身就是推理引擎,围绕PagedAttention内存管理构建
CLI模型管理
- OpenLLM:
openllm model list、openllm repo update,支持模型名称简写- vLLM:
- 主要是一条服务命令(
vllm serve <model>),内置目录管理工具较少
内置聊天界面
- OpenLLM:
- 有,位于
/chat端点 - vLLM:
- 没有内置聊天界面,通常需要搭配独立前端使用
托管云路径
- OpenLLM:
- 可选的
openllm deploy可接入BentoCloud(BentoML,付费) - vLLM:
- 没有自己的官方托管云产品
维护方
- OpenLLM:
- BentoML
- vLLM:
- vLLM开源项目——详情参见vLLM解读文章
如果你最看重的是作为自有技术栈构建模块的原始推理吞吐速度,请直接评估vLLM。如果你更看重带有模型管理和可选托管云部署路径的更高层OpenAI兼容服务器,OpenLLM的功能集更为全面——而且二者并非互斥,因为OpenLLM可以将vLLM作为其后端来运行。
OpenLLM适合谁使用?
OpenLLM是否适合你,取决于你是否想要一个免费、可自托管、OpenAI兼容的服务层,并保留一条可选的托管云退路,而不是一个单纯的推理库或可下载的聊天应用。
竞品与替代方案
OpenLLM是众多将开源权重模型推理封装在OpenAI兼容API背后的工具之一。以下是它在推理服务器这一细分领域与其他选项的对比——完整目录请参阅本地大模型软件目录,最直接的对比请参阅上文专门的OpenLLM vs. vLLM对比。
评估OpenLLM时的常见误区
围绕OpenLLM的大多数误解,都来自它与BentoCloud的关系、它与vLLM的关系,或是误以为最新的正式版本标签就代表最新代码。
常见问题
OpenLLM是什么?
OpenLLM(github.com/bentoml/OpenLLM)是BentoML推出的免费开源推理服务器,采用Apache-2.0许可证,能用一条CLI命令将开源权重大模型转换为OpenAI兼容的API端点。
OpenLLM是免费的吗?
是的。OpenLLM软件免费开源,没有自己的付费层级。BentoML另一款独立的托管产品BentoCloud是收费的,但使用它是可选的——OpenLLM的每条核心命令都运行在你自己掌控的基础设施上。
OpenLLM采用什么许可证?
Apache-2.0,已通过GitHub仓库的许可证元数据确认。
OpenLLM需要BentoCloud吗?
不需要。openllm serve、openllm run和openllm model list都完全运行在你自己的硬件上。只有运行openllm deploy时才会涉及BentoCloud,这是一条可选、单独付费的部署路径。
OpenLLM支持哪些模型?
据官方README介绍,OpenLLM支持15+个开源权重模型系列,包括Llama(3.1、3.2、3.3、4)、Mistral(8B和Large 123B)、Qwen(2.5和2.5-Coder)、Gemma(2和3)、Phi(4)、DeepSeek(R1)、Pixtral、Jamba和QwQ,这些模型通过配套仓库openllm-models解析。
如何安装OpenLLM?
运行pip install openllm,然后可以运行openllm hello快速交互式上手,或运行openllm serve <model-name>启动本地OpenAI兼容服务器。
OpenLLM使用vLLM吗?
可以使用。据官方文档介绍,OpenLLM将vLLM集成为可用的推理后端之一,而非只提供从零构建的自研推理实现。
OpenLLM和vLLM有什么区别?
vLLM是高吞吐推理引擎/库;OpenLLM是更高层的服务框架,将某个推理后端(vLLM是其中之一)包装在模型管理、OpenAI兼容API、内置聊天界面和可选的托管云部署路径之中。详见上方专门的OpenLLM vs. vLLM对比。
OpenLLM还在积极维护吗?
该仓库创建于2023年4月19日,据GitHub API显示最近一次推送发生在2026年9月14日,表明开发仍在持续。其最新的正式版本标签是v0.6.30(2025年4月21日)——本文指出了这一差距,请直接在GitHub或PyPI上核实当前发布状态。