关键要点
- 在GitHub(BerriAI/litellm)开源;截至本评测约有58,663个星标和11,415个fork
- 核心仓库根据其自身LICENSE文件采用MIT许可;另有单独许可仅适用于
enterprise/子目录——本评测已直接核对LICENSE文件加以验证 - 两款产品:Python SDK
litellm(pip install litellm),用于直接从代码调用提供商;以及LiteLLM Proxy Server(`pip install 'litellm[proxy]'`或Docker),作为带管理仪表盘的自托管网关 - 根据项目自身README,将100多个提供商API(OpenAI、Anthropic、Google Gemini、AWS Bedrock、Azure OpenAI、Ollama等)统一在同一请求/响应格式之后
- README和文档站点中记录的功能:负载均衡、路由、故障转移/失败切换、按密钥和按用户的预算、速率限制、请求缓存与支出日志
- 无需GPU——LiteLLM转发请求而非执行模型权重;代理的生产部署需要PostgreSQL(密钥、支出数据)和Redis(跨实例速率限制),而非GPU
- 可通过Docker(
docker.litellm.ai/berriai/litellm)、Helm charts、官方AWS ECS Fargate Terraform模块、官方Google Cloud Run Terraform模块,或Render/Railway一键部署按钮进行部署 - litellm.ai/enterprise提供单独的商业Enterprise层级,涵盖SSO、优先功能请求和专属支持——开源SDK和代理无需它也能完全可用
📍 简单一句话
LiteLLM是一个开源网关,让应用通过单一的OpenAI兼容接口调用100多个LLM提供商API,可作为Python SDK使用,也可作为具备路由、故障转移、成本追踪和速率限制功能的自托管代理服务器使用。
💬 简单来说
如果你的应用今天要对接OpenAI,明天又要对接Anthropic或本地的Ollama模型,通常你得为每一个重写集成代码。LiteLLM居中充当翻译层,把每个提供商的API都转换成同一种类OpenAI格式,这样你的代码只需学会一种格式——而代理版本还额外提供一个仪表盘,用来查看谁花了多少钱。
📌注: 本评测是本地LLM软件目录中LiteLLM条目的深度补充——该页面展示了LiteLLM与其他数十款本地AI工具的一览式对比。
LiteLLM是什么?
LiteLLM是一个网关,将单一的OpenAI兼容请求格式转换为对100多个不同LLM提供商API的调用。 它自身的GitHub README将其描述为"最快、最轻量的AI网关",采用Rust核心加Python SDK的架构——这是相较项目早期纯Python实现的一次转变。应用无需为OpenAI API、Anthropic API和本地Ollama服务器分别编写客户端代码,只需调用一次LiteLLM,由LiteLLM将请求转发给该模型名称所配置的提供商。
- 核心功能:接收OpenAI的
chat/completions格式(或目标提供商的原生格式)请求,转发给已配置的提供商,并返回标准化响应 - 两种接入方式:直接导入应用代码的Python SDK
litellm,以及供其他应用通过HTTP调用的独立服务LiteLLM Proxy Server - 开发方:BerriAI,即github.com/BerriAI/litellm仓库背后的组织
- 并非模型运行时:LiteLLM本身不加载模型权重也不执行推理——它将请求路由给真正执行这些操作的提供商,包括云端API和Ollama、vLLM等本地服务器
- 根据文档,生产级代理功能包括:虚拟API密钥、按密钥和按用户的支出预算、速率限制、同一模型多个部署间的负载均衡,以及提供商出错时的自动故障转移
LiteLLM能做什么?
根据LiteLLM自身文档,其功能集涵盖请求路由、成本控制与可靠性——这些正是随着提供商和用户数量增加而愈发棘手的LLM应用运维部分。
- 统一的API接口 — 发送OpenAI格式的请求;LiteLLM将其转换为目标模型所需提供商的原生格式,并将响应标准化后返回
- 路由与负载均衡 — 将流量分散到同一模型的多个部署(例如多个Azure OpenAI区域),以避免单点故障或触及速率限制上限
- 故障转移与重试逻辑 — 请求失败时自动向另一个提供商或模型部署重试,而不是将错误直接暴露给终端用户
- 成本追踪与预算 — 按API密钥、用户或团队记录支出,并设置硬性预算上限,一旦超出即阻止后续请求
- 速率限制 — 按密钥或用户限制每分钟/每token的请求数,并通过Redis在多个代理实例间保持一致
- 护栏与日志 — 提供内容审核和可观测性集成的钩子,以及用于审计的结构化请求/响应日志
- 管理仪表盘 — 一个Web界面(在代理的
/ui提供),用于管理虚拟密钥、查看支出及配置模型,无需直接编辑配置文件 - 同样适用于本地运行时 — 调用OpenAI或Anthropic的同一路由层,也可以同样指向本地的Ollama或vLLM端点,使一个网关能够混合云端模型和本地模型
使用示例:使用LiteLLM的两种方式
以下是基于上述LiteLLM文档化安装路径构建的具体工作流程——而非假设性用例。
安装LiteLLM:SDK、代理与Docker
LiteLLM是一个框架兼自托管网关,而不是面向终端用户的可下载应用——没有可以从应用商店"获取"的安装程序。 以下是根据LiteLLM自身文档和Docker快速入门整理的实际安装与快速启动命令;部署前请务必直接查阅文档,因为具体参数和镜像标签可能随版本变化。
Python SDK
- 命令:
pip install litellm(或uv add litellm)
Proxy Server(pip)
- 命令:
- `pip install 'litellm[proxy]'
,然后litellm --model gpt-4o`
Proxy Server(Docker)
- 命令:
docker run -v $(pwd)/config.yaml:/app/config.yaml -e OPENAI_API_KEY=<key> -e LITELLM_MASTER_KEY=sk-1234 -p 4000:4000 docker.litellm.ai/berriai/litellm:latest --config /app/config.yaml
Helm(Kubernetes)
- 命令:
helm install litellm oci://ghcr.io/berriai/litellm-helm -f values.yaml
AWS ECS Fargate
- 命令:
- 官方Terraform模块
BerriAI/litellm/aws(配置VPC、Aurora PostgreSQL、ElastiCache Redis、ALB、ECS)
Google Cloud Run
- 命令:
- 官方Terraform模块
BerriAI/litellm/google(配置Cloud SQL、Memorystore Redis、GCS、HTTPS负载均衡器)
代理默认使用4000端口,管理仪表盘位于http://localhost:4000/ui(默认登录:用户名admin,密码与你的LITELLM_MASTER_KEY相同)。最简config.yaml需要一个model_list数组,将model_name映射到litellm_params(真实的提供商模型字符串及其API密钥)——完整示例参见代理快速入门。根据LiteLLM的部署文档,Render和Railway也为代理提供了一键部署按钮。
LiteLLM定价:真的免费吗?
开源SDK和Proxy Server是免费的——你只需为经LiteLLM路由的底层提供商API调用付费,外加自己的托管成本。 对于开源路径,LiteLLM本身不按请求或按token收费。根据项目自身网站,litellm.ai/enterprise提供单独的付费LiteLLM Enterprise层级,涵盖SSO、优先功能请求和专属支持——本评测未找到公开的Enterprise定价,建议直接联系LiteLLM获取报价。
- 开源SDK和Proxy Server:无许可费用,核心仓库采用MIT许可(见下方许可说明)
- 你仍需向所路由到的提供商付费——LiteLLM并不降低OpenAI、Anthropic或Bedrock的API价格,只是将其统一并记录
- 自托管代理有其自身的基础设施成本:服务器或容器托管,外加生产使用所需的PostgreSQL和Redis
- 根据litellm.ai/enterprise,LiteLLM Enterprise在同一开源核心之上增加SSO、优先支持及其他商业功能——价格未公开,需联系公司获取
LiteLLM 对比 vLLM 与 LocalAI
LiteLLM、vLLM和LocalAI解决的是不同的问题,因为三者都提供OpenAI兼容API,所以很容易被混淆。 LiteLLM将请求路由到运行在别处的模型;vLLM和LocalAI则自己执行模型权重。
谁适合使用LiteLLM?
LiteLLM是否适合,取决于你的应用是否已经调用(或计划调用)不止一个LLM提供商——单一提供商的应用从路由层获得的收益较小。
LiteLLM 对比其他网关与框架
截至本评测时,LiteLLM是PromptQuorum本地LLM软件目录中第一款拥有专门评测的路由器/网关类工具——目前还没有第二款同一细分领域(路由器/网关)的工具可供直接对比。因此,最接近的有用比较来自目录中同属"运行与服务"部分的相邻工具,以及目录之外一个广为人知的托管替代方案。
- vLLM — 一个真正提供模型权重服务的自托管推理引擎(需要GPU);通常与LiteLLM搭配使用而非与之竞争,由LiteLLM作为路由层置于一个或多个vLLM部署之前。
- LocalAI — 一个用于本地运行开放模型的自托管、OpenAI兼容API服务器;它解决的是与LiteLLM不同的问题(提供服务 vs. 路由),但暴露出类似的OpenAI格式API,这也是两者常被混淆的原因。
- LangChain — 一个用于构建LLM驱动应用(链、智能体、记忆)的应用框架;它可以调用LiteLLM(或直接调用任何提供商)作为其模型访问层,而不是取代LiteLLM所做的事情。
- OpenRouter(外部工具,未收录于PromptQuorum目录) — 一个托管、受管理的路由服务,覆盖与LiteLLM代理类似的多提供商场景,但它是你调用的第三方服务,而非你自行托管的基础设施;如果你想要零运维路由而不是自己运行代理,值得直接对比。
评估LiteLLM时的常见误区
关于LiteLLM的大多数困惑,来自将其与模型服务引擎混淆,或对其许可协议过度简化。
常见问题
LiteLLM是什么?
LiteLLM(github.com/BerriAI/litellm)是一个开源网关,让应用通过单一的OpenAI兼容接口调用100多个LLM提供商API,可作为Python SDK使用,也可作为具备路由、成本追踪和速率限制功能的自托管代理服务器使用。
LiteLLM是免费的吗?
开源SDK和Proxy Server是免费的——你只需为底层提供商API调用和自己的托管付费。单独的付费LiteLLM Enterprise层级增加了SSO和专属支持;其价格未公开,需直接联系LiteLLM。
LiteLLM使用哪种许可协议?
根据仓库自身的LICENSE文件,核心仓库采用MIT许可。另有单独许可仅适用于enterprise/子目录,见enterprise/LICENSE——本评测已直接核对仓库的LICENSE文件加以验证。
LiteLLM需要GPU吗?
不需要。LiteLLM是请求路由器,而非模型推理引擎——它将调用转发给提供商(云端API或Ollama等本地运行时),而不是自己执行模型权重,因此在纯CPU硬件上也能良好运行。
如何安装LiteLLM?
Python SDK:pip install litellm。自托管代理:`pip install 'litellm[proxy]',然后litellm --model gpt-4o;或挂载config.yaml运行Docker镜像docker.litellm.ai/berriai/litellm:latest`。Helm、AWS ECS Fargate和Google Cloud Run选项参见上方安装表格。
LiteLLM代理需要数据库吗?
生产使用需要——根据LiteLLM自身的部署文档,PostgreSQL持久化虚拟密钥和支出数据,Redis在多个代理实例间保持速率限制一致。快速本地测试可以不用两者运行,但会失去这些功能。
LiteLLM能否路由到本地托管的模型?
可以。指向OpenAI或Anthropic的同一份config.yaml中的model_list,同样可以指向本地的Ollama或vLLM端点,使一个网关能够混合云端和本地模型。
LiteLLM与OpenRouter相比如何?
两者都在单一接口之后统一了多个LLM提供商。LiteLLM是你自行运维的自托管基础设施(开源代理或SDK);OpenRouter是你调用而非自行运维的第三方托管路由服务。选择取决于你是想要零运维(OpenRouter),还是想要没有路由提供商按请求加价的完全掌控(自托管LiteLLM)。
LiteLLM由谁开发?
BerriAI,即github.com/BerriAI/litellm仓库背后的组织,截至本评测显示约有58,663个星标和11,415个fork。
