关键要点
- LoRAX(github.com/predibase/lorax)是一款免费、开源、可自托管的多LoRA推理服务器
- 由Predibase开发,这是一家由Google和Uber校友于2021年创立的机器学习平台公司;Rubrik于2025年6月25日宣布收购Predibase
- 采用Apache 2.0许可,项目方称可免费用于商业用途
- 是Hugging Face的text-generation-inference(自v0.9.4起)的分支,随后扩展了动态多LoRA适配器加载功能
- 需要一块NVIDIA GPU,Ampere架构或更新,CUDA 11.8+,运行于Linux
- 支持通过PEFT或Ludwig训练的适配器;可从HuggingFace Hub、Predibase或本地文件系统路径加载
- 截至本评测撰写时,GitHub星标超过3,800,fork超过324
📍 简单一句话
LoRAX是一款免费、开源(Apache 2.0)、可自托管的推理服务器,是Hugging Face的text-generation-inference的分支,由Predibase开发(2025年被Rubrik收购),在一块GPU上、基于一个共享基础模型提供数千个微调LoRA适配器的服务,GitHub星标超过3,800。
💬 简单来说
与为基础LLM的每个微调变体单独运行一台GPU托管模型不同,LoRAX只加载一份共享的基础模型副本,并按请求动态换入小型LoRA适配器权重——这样一块GPU就能同时提供同一模型的多个不同微调"人格"的服务,成本仅为每个模型单独配置一块GPU的一小部分。
📌注: 本评测基于LoRAX自己的GitHub仓库、README和发布说明撰写。本文并不声称PromptQuorum已就吞吐量或延迟对其与其他推理服务器进行了独立基准测试——在做生产环境容量规划决策前,请查阅项目自身文档中的最新性能数据。
LoRAX是什么?
LoRAX("LoRA eXchange")是一款专门用于在一个共享基础模型之上提供多个微调LoRA适配器服务的自托管推理服务器,而不需要为每个微调模型单独部署。 按其官方定位,它是"以一块GPU的价格,在生产环境中提供数百个微调LLM服务的开源框架"。
- 产品类型:一款自托管推理服务器(命令行工具+代码库),不是托管API,也不是桌面应用
- 开发方:Predibase,由Google和Uber校友于2021年创立的机器学习平台公司
- 公司状态:数据安全公司Rubrik于2025年6月25日宣布已达成收购Predibase的协议;Predibase的商业平台现已归入Rubrik旗下,而开源的LoRAX项目仍在Predibase组织名下于GitHub发布
- 基础:是Hugging Face的text-generation-inference(自v0.9.4起)的分支,随后专门为动态多适配器服务进行了扩展
- 许可:Apache 2.0,已通过GitHub仓库确认
- 规模:截至本评测撰写时,GitHub星标超过3,800,fork超过324
项目历史与版本里程碑
LoRAX自2024年初发布以来持续更新,每个版本都增加了更广泛的模型支持、量化选项和服务功能。 以下版本号和日期均来自项目自己的GitHub发布说明;本评测发布日期之后的任何更新,请直接查看发布页面。
- 1v0.6.0——2024年1月10日:OpenAI兼容API
Why it matters: 增加了OpenAI兼容的completions和chat-completions端点,使现有OpenAI客户端代码能够指向自托管的LoRAX服务器。 - 2v0.7.0——2024年2月1日:多适配器合并,EETQ/HQQ量化
Why it matters: 支持通过linear、TIES和DARE方法按请求合并多个LoRA适配器,并新增两种量化格式。 - 3v0.8.0–v0.8.1——2024年2月:结构化输出与Gemma支持
Why it matters: 通过Outlines库增加了JSON schema引导的结构化输出,并支持Google的Gemma模型系列。 - 4v0.9.0——2024年3月23日:专用适配器内存,Qwen2支持
Why it matters: 按发布说明,为适配器预留了专用GPU内存,并新增对Qwen2模型的支持。 - 5v0.10.0——2024年5月23日:Medusa推测解码
Why it matters: 新增Medusa推测解码适配器,以及对Phi-3、Command-R和DBRX模型的支持,旨在加快生成速度。 - 6v0.11.0——2024年9月18日:前缀缓存,视觉语言支持
Why it matters: 新增了针对重复提示的前缀缓存、视觉语言模型Llava-Next支持,以及针对Mistral和Llama模型的FP8量化。 - 7v0.12.0——2024年11月6日:多LoRA前缀缓存,函数调用
Why it matters: 按更新日志,将前缀缓存扩展到可跨多个适配器同时生效,新增FP8 KV缓存支持,并加入带schema强制校验的函数调用——这是本评测能从公开发布说明中确认的最新里程碑。
LoRAX实际上做什么?
LoRAX将一个共享基础模型加载到GPU内存中,然后按每个传入请求动态加载并交换小型LoRA适配器权重,从而可以从单次部署中提供许多微调模型变体的服务。
- 动态适配器加载——LoRA适配器按请求按需加载,而不要求预先加载每个适配器,并通过异步预取和在GPU与CPU内存之间的卸载来管理哪些适配器保持"热点"
- 异构连续批处理——按其自身架构描述,将针对不同适配器的请求打包进同一批次,而不需要每个适配器单独一批
- 基础模型支持——按发布说明,兼容Llama、CodeLlama、Mistral、Zephyr、Qwen、Gemma、Phi-3、Command-R、DBRX,以及Mllama/Llava-Next视觉语言模型
- 量化选项——fp16,或使用bitsandbytes、GPT-Q、AWQ、EETQ、HQQ量化,并在后续版本中加入了FP8 KV缓存支持
- 适配器兼容性——支持通过PEFT或Ludwig训练的适配器,可从HuggingFace Hub、Predibase或本地文件系统路径加载
- OpenAI兼容API——以OpenAI请求/响应格式提供chat-completions和completions端点,使现有OpenAI客户端代码能够指向自托管的LoRAX服务器
- 服务基础设施功能——按其文档,支持张量并行、flash-attention、paged attention、令牌流式传输、Prometheus指标和OpenTelemetry追踪
- 结构化输出——通过Outlines库实现JSON schema引导的生成,并在后续版本中支持带schema强制校验的函数调用
使用示例:使用LoRAX的三种方式
以下是基于LoRAX自身已文档化功能构建的具体工作流,而非假设性用例。
平台、定价与许可
平台
- LoRAX的官方说明:
- 自托管,仅支持Linux;需要一块NVIDIA GPU,Ampere架构或更新,配合CUDA 11.8+。
费用
- LoRAX的官方说明:
- 免费开源,项目方称可免费用于商业用途。你只需为自己的GPU基础设施付费——没有单独的付费LoRAX层级。
许可
- LoRAX的官方说明:
- Apache 2.0,已通过GitHub仓库确认。
安装方式
- LoRAX的官方说明:
- Docker镜像(
ghcr.io/predibase/lorax:main),另有已文档化的Kubernetes和SkyPilot部署路径;Python客户端通过pip单独安装。
Predibase(LoRAX的开发方,2025年被收购后现已归入Rubrik旗下)还另外销售一款基于相关技术构建的独立托管商业平台——如果你需要的是托管服务而非自托管,请直接向Predibase/Rubrik核实当前的商业定价。
安装LoRAX
LoRAX作为自托管服务器,可通过Docker、Kubernetes或SkyPilot运行,Python客户端可通过pip单独安装。
Source | Link |
|---|---|
| GitHub仓库(源代码,Apache 2.0) | github.com/predibase/lorax |
| Docker镜像 | docker pull ghcr.io/predibase/lorax:main |
| Python客户端 | pip install lorax-client |
| 文档 | loraexchange.ai |
LoRAX在Linux上需要一块NVIDIA GPU(Ampere架构或更新)配合CUDA 11.8+——没有纯CPU模式,也没有macOS/Windows原生安装路径。运行任何命令前,请务必查阅GitHub README以获取当前推荐的部署方法。
LoRAX与通用推理引擎的对比
LoRAX与LMDeploy或NVIDIA Dynamo等通用推理引擎都能大规模提供LLM服务,但LoRAX是专门为一个特定问题打造的:低成本地在一个基础模型上提供多个LoRA适配器的服务。
方面 | LoRAX | 通用推理引擎 |
|---|---|---|
| 核心任务 | 在一个基础模型上提供多个LoRA适配器的服务 | 以高吞吐量提供一个或多个完整模型的服务 |
| 多适配器批处理 | 内置异构连续批处理 | 通常不是核心重点 |
| 基础 | Hugging Face text-generation-inference的分支 | 因项目而异 |
| OpenAI兼容API | 有 | 通常也有 |
| 最佳适用场景 | 同一基础模型的多个微调变体 | 模型数量较少、追求最大原始吞吐量 |
如果你的工作负载是为同一基础模型的多个微调变体(按客户或按任务划分的适配器)提供服务,LoRAX以适配器为核心的批处理正是为此而设计的。如果你只需以最大原始吞吐量服务少数几个不同的完整模型、且没有适配器切换需求,通用引擎可能更合适——由于两类项目都会频繁发布性能改进,选择前请在各自官网核实最新基准数据。
谁适合使用LoRAX?
LoRAX适合那些已经拥有或计划拥有大量基于同一基础模型的微调LoRA适配器、并希望从共享GPU容量中经济高效地提供服务的团队。
LoRAX不适合哪些场景
如果你需要纯CPU或非Linux部署、需要训练而非服务适配器,或需要完全托管的平台,LoRAX并不合适。
- 不支持纯CPU——需要一块NVIDIA GPU,Ampere架构或更新,配合CUDA 11.8+;没有CPU回退模式
- 服务端本身不跨平台——按其官方文档,LoRAX的服务器仅在Linux上运行
- 不是训练工具——LoRAX服务的是已经在别处(通过PEFT、Ludwig或类似方式)训练好的LoRA适配器;它本身不进行模型微调
- 本身不是托管服务——它是自托管的开源软件;如果你需要托管选项,Predibase另有独立的商业平台(2025年被收购后现已归入Rubrik旗下)
- PromptQuorum未就吞吐量或延迟对其进行独立基准测试——本评测基于LoRAX自身的文档和发布说明,而非实机测试
评估LoRAX时的常见误区
关于LoRAX的大多数误解,来自期望它能训练适配器、期望它能无GPU运行,或假设Predibase被收购后其企业背景没有变化。
竞品与替代方案
由于LoRAX正好处在推理服务与LoRA微调这两个领域的交叉点上,它最常被拿来与其他自托管推理和微调工具比较。 可与本地LLM软件目录中LoRAX自己的条目搭配参考。
Tool | Best known for | Link |
|---|---|---|
| LMDeploy | 带量化和服务工具包的开源推理引擎 | LMDeploy评测 |
| NVIDIA Dynamo | 带API服务器功能的高吞吐量推理服务框架 | NVIDIA Dynamo评测 |
| Unsloth | 快速、内存高效的LoRA/QLoRA微调库 | Unsloth评测 |
| LLaMA-Factory | 支持LoRA及其他PEFT方法的统一微调框架 | LLaMA-Factory评测 |
此列表反映的是与LoRAX处于同一推理服务和LoRA微调领域的工具,并非PromptQuorum的独立排名——由于LoRAX专注多适配器服务的定位与通用推理引擎或纯训练工具并不相同,选择前请核实每个工具当前的功能集。
常见问题
LoRAX是什么?
LoRAX("LoRA eXchange",github.com/predibase/lorax)是一款免费、开源、可自托管的推理服务器,在一块GPU上、基于一个共享基础模型提供多个微调LoRA适配器的服务。
LoRAX是免费的吗?
是的,LoRAX本身免费、开源(Apache 2.0),项目方称可免费用于商业用途。你只需为运行它所使用的GPU基础设施付费。
LoRAX是谁开发的?
LoRAX由Predibase开发,这是一家由Google和Uber校友于2021年创立的机器学习平台公司。数据安全公司Rubrik于2025年6月25日宣布已达成收购Predibase的协议。
LoRAX需要什么GPU?
需要一块NVIDIA GPU,Ampere架构或更新,配合CUDA 11.8+,运行于Linux。没有纯CPU模式,也没有macOS/Windows原生服务器部署。
如何安装LoRAX?
作为自托管服务器,通过Docker镜像(ghcr.io/predibase/lorax:main)安装,同时也文档化了Kubernetes和SkyPilot部署路径。Python客户端通过pip install lorax-client单独安装。
LoRAX支持哪些基础模型?
按其发布说明:Llama、CodeLlama、Mistral、Zephyr、Qwen、Gemma、Phi-3、Command-R、DBRX,以及Mllama/Llava-Next视觉语言模型等——完整、最新的列表请查阅当前文档。
LoRAX会训练LoRA适配器吗?
不会。LoRAX是一款推理服务器,服务的是已经通过PEFT、Ludwig或类似工具在别处训练好的适配器。如果你需要先生成适配器,请搭配Unsloth或LLaMA-Factory等专门的微调工具使用。
LoRAX有OpenAI兼容API吗?
有。LoRAX以OpenAI请求/响应格式提供chat-completions和completions端点,使现有OpenAI客户端代码能够指向自托管的LoRAX服务器。
LoRAX支持哪些量化格式?
按其发布说明:fp16,以及通过bitsandbytes、GPT-Q、AWQ、EETQ或HQQ进行的量化,还有在后续版本中加入的FP8 KV缓存支持。
PromptQuorum是否独立测试过LoRAX的性能宣称?
本评测基于LoRAX自己的GitHub仓库、README和发布说明撰写,并非PromptQuorum的实机基准测试。在做生产环境容量规划决策前,请直接在项目自身文档中核实当前的吞吐量和延迟数据。