Skip to main content
PromptQuorum
主页/本地LLM进阶/LoRAX评测:在一块GPU上提供数千个LoRA适配器服务
Overview & Reference

LoRAX评测:在一块GPU上提供数千个LoRA适配器服务

·10分钟阅读·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

LoRAX是一款免费、开源、可自托管的推理服务器,它在一个共享基础模型之上、用一块GPU提供多个微调LoRA适配器的服务,而不需要为每个微调模型配备一块独立GPU。 它由Predibase开发(2025年被Rubrik收购),采用Apache 2.0许可,是Hugging Face的text-generation-inference的一个分支,并增加了动态适配器加载、跨适配器的异构连续批处理,以及OpenAI兼容API,按其官方定位,一次部署即可"以一块GPU的价格"提供数千个适配器的服务。

LoRAX("LoRA eXchange",github.com/predibase/lorax)是一款免费、开源、可自托管的推理服务器,专门用于在一个共享基础模型之上提供多个微调LoRA适配器的服务,无需为每个适配器配备一块独立GPU。它由Predibase开发,这是一家成立于2021年的机器学习平台公司,已于2025年被数据安全厂商Rubrik收购。本评测介绍LoRAX的实际功能、它与通用推理引擎的区别、安装方法,以及适合哪些用户。

关键要点

  • LoRAX(github.com/predibase/lorax)是一款免费、开源、可自托管的多LoRA推理服务器
  • Predibase开发,这是一家由Google和Uber校友于2021年创立的机器学习平台公司;Rubrik于2025年6月25日宣布收购Predibase
  • 采用Apache 2.0许可,项目方称可免费用于商业用途
  • 是Hugging Face的text-generation-inference(自v0.9.4起)的分支,随后扩展了动态多LoRA适配器加载功能
  • 需要一块NVIDIA GPU,Ampere架构或更新,CUDA 11.8+,运行于Linux
  • 支持通过PEFT或Ludwig训练的适配器;可从HuggingFace Hub、Predibase或本地文件系统路径加载
  • 截至本评测撰写时,GitHub星标超过3,800,fork超过324

📍 简单一句话

LoRAX是一款免费、开源(Apache 2.0)、可自托管的推理服务器,是Hugging Face的text-generation-inference的分支,由Predibase开发(2025年被Rubrik收购),在一块GPU上、基于一个共享基础模型提供数千个微调LoRA适配器的服务,GitHub星标超过3,800。

💬 简单来说

与为基础LLM的每个微调变体单独运行一台GPU托管模型不同,LoRAX只加载一份共享的基础模型副本,并按请求动态换入小型LoRA适配器权重——这样一块GPU就能同时提供同一模型的多个不同微调"人格"的服务,成本仅为每个模型单独配置一块GPU的一小部分。

📌: 本评测基于LoRAX自己的GitHub仓库、README和发布说明撰写。本文并不声称PromptQuorum已就吞吐量或延迟对其与其他推理服务器进行了独立基准测试——在做生产环境容量规划决策前,请查阅项目自身文档中的最新性能数据。

LoRAX是什么?

LoRAX("LoRA eXchange")是一款专门用于在一个共享基础模型之上提供多个微调LoRA适配器服务的自托管推理服务器,而不需要为每个微调模型单独部署。 按其官方定位,它是"以一块GPU的价格,在生产环境中提供数百个微调LLM服务的开源框架"。

  • 产品类型:一款自托管推理服务器(命令行工具+代码库),不是托管API,也不是桌面应用
  • 开发方:Predibase,由Google和Uber校友于2021年创立的机器学习平台公司
  • 公司状态:数据安全公司Rubrik于2025年6月25日宣布已达成收购Predibase的协议;Predibase的商业平台现已归入Rubrik旗下,而开源的LoRAX项目仍在Predibase组织名下于GitHub发布
  • 基础:是Hugging Face的text-generation-inference(自v0.9.4起)的分支,随后专门为动态多适配器服务进行了扩展
  • 许可:Apache 2.0,已通过GitHub仓库确认
  • 规模:截至本评测撰写时,GitHub星标超过3,800,fork超过324

项目历史与版本里程碑

LoRAX自2024年初发布以来持续更新,每个版本都增加了更广泛的模型支持、量化选项和服务功能。 以下版本号和日期均来自项目自己的GitHub发布说明;本评测发布日期之后的任何更新,请直接查看发布页面

  1. 1
    v0.6.0——2024年1月10日:OpenAI兼容API
    Why it matters: 增加了OpenAI兼容的completions和chat-completions端点,使现有OpenAI客户端代码能够指向自托管的LoRAX服务器。
  2. 2
    v0.7.0——2024年2月1日:多适配器合并,EETQ/HQQ量化
    Why it matters: 支持通过linear、TIES和DARE方法按请求合并多个LoRA适配器,并新增两种量化格式。
  3. 3
    v0.8.0–v0.8.1——2024年2月:结构化输出与Gemma支持
    Why it matters: 通过Outlines库增加了JSON schema引导的结构化输出,并支持Google的Gemma模型系列。
  4. 4
    v0.9.0——2024年3月23日:专用适配器内存,Qwen2支持
    Why it matters: 按发布说明,为适配器预留了专用GPU内存,并新增对Qwen2模型的支持。
  5. 5
    v0.10.0——2024年5月23日:Medusa推测解码
    Why it matters: 新增Medusa推测解码适配器,以及对Phi-3、Command-R和DBRX模型的支持,旨在加快生成速度。
  6. 6
    v0.11.0——2024年9月18日:前缀缓存,视觉语言支持
    Why it matters: 新增了针对重复提示的前缀缓存、视觉语言模型Llava-Next支持,以及针对Mistral和Llama模型的FP8量化。
  7. 7
    v0.12.0——2024年11月6日:多LoRA前缀缓存,函数调用
    Why it matters: 按更新日志,将前缀缓存扩展到可跨多个适配器同时生效,新增FP8 KV缓存支持,并加入带schema强制校验的函数调用——这是本评测能从公开发布说明中确认的最新里程碑。

LoRAX实际上做什么?

LoRAX将一个共享基础模型加载到GPU内存中,然后按每个传入请求动态加载并交换小型LoRA适配器权重,从而可以从单次部署中提供许多微调模型变体的服务。

  • 动态适配器加载——LoRA适配器按请求按需加载,而不要求预先加载每个适配器,并通过异步预取和在GPU与CPU内存之间的卸载来管理哪些适配器保持"热点"
  • 异构连续批处理——按其自身架构描述,将针对不同适配器的请求打包进同一批次,而不需要每个适配器单独一批
  • 基础模型支持——按发布说明,兼容Llama、CodeLlama、Mistral、Zephyr、Qwen、Gemma、Phi-3、Command-R、DBRX,以及Mllama/Llava-Next视觉语言模型
  • 量化选项——fp16,或使用bitsandbytes、GPT-Q、AWQ、EETQ、HQQ量化,并在后续版本中加入了FP8 KV缓存支持
  • 适配器兼容性——支持通过PEFTLudwig训练的适配器,可从HuggingFace Hub、Predibase或本地文件系统路径加载
  • OpenAI兼容API——以OpenAI请求/响应格式提供chat-completions和completions端点,使现有OpenAI客户端代码能够指向自托管的LoRAX服务器
  • 服务基础设施功能——按其文档,支持张量并行、flash-attention、paged attention、令牌流式传输、Prometheus指标和OpenTelemetry追踪
  • 结构化输出——通过Outlines库实现JSON schema引导的生成,并在后续版本中支持带schema强制校验的函数调用

使用示例:使用LoRAX的三种方式

以下是基于LoRAX自身已文档化功能构建的具体工作流,而非假设性用例。

平台、定价与许可

平台

LoRAX的官方说明:
自托管,仅支持Linux;需要一块NVIDIA GPU,Ampere架构或更新,配合CUDA 11.8+。

费用

LoRAX的官方说明:
免费开源,项目方称可免费用于商业用途。你只需为自己的GPU基础设施付费——没有单独的付费LoRAX层级。

许可

LoRAX的官方说明:
Apache 2.0,已通过GitHub仓库确认。

安装方式

LoRAX的官方说明:
Docker镜像(ghcr.io/predibase/lorax:main),另有已文档化的Kubernetes和SkyPilot部署路径;Python客户端通过pip单独安装。

Predibase(LoRAX的开发方,2025年被收购后现已归入Rubrik旗下)还另外销售一款基于相关技术构建的独立托管商业平台——如果你需要的是托管服务而非自托管,请直接向Predibase/Rubrik核实当前的商业定价。

LoRAX与通用推理引擎的对比

LoRAX与LMDeploy或NVIDIA Dynamo等通用推理引擎都能大规模提供LLM服务,但LoRAX是专门为一个特定问题打造的:低成本地在一个基础模型上提供多个LoRA适配器的服务。

方面
LoRAX
通用推理引擎
核心任务在一个基础模型上提供多个LoRA适配器的服务以高吞吐量提供一个或多个完整模型的服务
多适配器批处理内置异构连续批处理通常不是核心重点
基础Hugging Face text-generation-inference的分支因项目而异
OpenAI兼容API通常也有
最佳适用场景同一基础模型的多个微调变体模型数量较少、追求最大原始吞吐量

如果你的工作负载是为同一基础模型的多个微调变体(按客户或按任务划分的适配器)提供服务,LoRAX以适配器为核心的批处理正是为此而设计的。如果你只需以最大原始吞吐量服务少数几个不同的完整模型、且没有适配器切换需求,通用引擎可能更合适——由于两类项目都会频繁发布性能改进,选择前请在各自官网核实最新基准数据。

谁适合使用LoRAX?

LoRAX适合那些已经拥有或计划拥有大量基于同一基础模型的微调LoRA适配器、并希望从共享GPU容量中经济高效地提供服务的团队。

LoRAX不适合哪些场景

如果你需要纯CPU或非Linux部署、需要训练而非服务适配器,或需要完全托管的平台,LoRAX并不合适。

  • 不支持纯CPU——需要一块NVIDIA GPU,Ampere架构或更新,配合CUDA 11.8+;没有CPU回退模式
  • 服务端本身不跨平台——按其官方文档,LoRAX的服务器仅在Linux上运行
  • 不是训练工具——LoRAX服务的是已经在别处(通过PEFT、Ludwig或类似方式)训练好的LoRA适配器;它本身不进行模型微调
  • 本身不是托管服务——它是自托管的开源软件;如果你需要托管选项,Predibase另有独立的商业平台(2025年被收购后现已归入Rubrik旗下)
  • PromptQuorum未就吞吐量或延迟对其进行独立基准测试——本评测基于LoRAX自身的文档和发布说明,而非实机测试

评估LoRAX时的常见误区

关于LoRAX的大多数误解,来自期望它能训练适配器、期望它能无GPU运行,或假设Predibase被收购后其企业背景没有变化。

竞品与替代方案

由于LoRAX正好处在推理服务与LoRA微调这两个领域的交叉点上,它最常被拿来与其他自托管推理和微调工具比较。 可与本地LLM软件目录中LoRAX自己的条目搭配参考。

Tool
Best known for
Link
LMDeploy带量化和服务工具包的开源推理引擎LMDeploy评测
NVIDIA Dynamo带API服务器功能的高吞吐量推理服务框架NVIDIA Dynamo评测
Unsloth快速、内存高效的LoRA/QLoRA微调库Unsloth评测
LLaMA-Factory支持LoRA及其他PEFT方法的统一微调框架LLaMA-Factory评测

此列表反映的是与LoRAX处于同一推理服务和LoRA微调领域的工具,并非PromptQuorum的独立排名——由于LoRAX专注多适配器服务的定位与通用推理引擎或纯训练工具并不相同,选择前请核实每个工具当前的功能集。

常见问题

LoRAX是什么?

LoRAX("LoRA eXchange",github.com/predibase/lorax)是一款免费、开源、可自托管的推理服务器,在一块GPU上、基于一个共享基础模型提供多个微调LoRA适配器的服务。

LoRAX是免费的吗?

是的,LoRAX本身免费、开源(Apache 2.0),项目方称可免费用于商业用途。你只需为运行它所使用的GPU基础设施付费。

LoRAX是谁开发的?

LoRAX由Predibase开发,这是一家由Google和Uber校友于2021年创立的机器学习平台公司。数据安全公司Rubrik于2025年6月25日宣布已达成收购Predibase的协议。

LoRAX需要什么GPU?

需要一块NVIDIA GPU,Ampere架构或更新,配合CUDA 11.8+,运行于Linux。没有纯CPU模式,也没有macOS/Windows原生服务器部署。

如何安装LoRAX?

作为自托管服务器,通过Docker镜像(ghcr.io/predibase/lorax:main)安装,同时也文档化了Kubernetes和SkyPilot部署路径。Python客户端通过pip install lorax-client单独安装。

LoRAX支持哪些基础模型?

按其发布说明:Llama、CodeLlama、Mistral、Zephyr、Qwen、Gemma、Phi-3、Command-R、DBRX,以及Mllama/Llava-Next视觉语言模型等——完整、最新的列表请查阅当前文档。

LoRAX会训练LoRA适配器吗?

不会。LoRAX是一款推理服务器,服务的是已经通过PEFT、Ludwig或类似工具在别处训练好的适配器。如果你需要先生成适配器,请搭配Unsloth或LLaMA-Factory等专门的微调工具使用。

LoRAX有OpenAI兼容API吗?

有。LoRAX以OpenAI请求/响应格式提供chat-completions和completions端点,使现有OpenAI客户端代码能够指向自托管的LoRAX服务器。

LoRAX支持哪些量化格式?

按其发布说明:fp16,以及通过bitsandbytes、GPT-Q、AWQ、EETQ或HQQ进行的量化,还有在后续版本中加入的FP8 KV缓存支持。

PromptQuorum是否独立测试过LoRAX的性能宣称?

本评测基于LoRAX自己的GitHub仓库、README和发布说明撰写,并非PromptQuorum的实机基准测试。在做生产环境容量规划决策前,请直接在项目自身文档中核实当前的吞吐量和延迟数据。

来源

← 返回 本地LLM进阶