Skip to main content
PromptQuorum
Início/LLMs locais avançados/Análise do LoRAX: servindo milhares de adaptadores LoRA em uma única GPU
Overview & Reference

Análise do LoRAX: servindo milhares de adaptadores LoRA em uma única GPU

·10 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

O LoRAX é um servidor de inferência gratuito, de código aberto e autogerenciado que serve muitos adaptadores LoRA ajustados sobre um único modelo base compartilhado, em uma única GPU, em vez de exigir uma GPU dedicada por modelo ajustado. Desenvolvido pela Predibase (adquirida pela Rubrik em 2025) e licenciado sob Apache 2.0, é um fork do text-generation-inference da Hugging Face e adiciona carregamento dinâmico de adaptadores, processamento em lote contínuo e heterogêneo entre adaptadores, além de uma API compatível com OpenAI, permitindo que uma única implantação sirva, segundo seu próprio posicionamento, milhares de adaptadores "pelo preço de um".

O LoRAX ("LoRA eXchange", github.com/predibase/lorax) é um servidor de inferência gratuito, de código aberto e autogerenciado, criado especificamente para servir muitos adaptadores LoRA ajustados sobre um único modelo base compartilhado, sem exigir uma GPU por adaptador. Foi criado pela Predibase, uma empresa de plataforma de ML fundada em 2021 e adquirida em 2025 pela fornecedora de segurança de dados Rubrik. Esta análise mostra o que o LoRAX realmente faz, em que se diferencia de um motor de inferência genérico, como instalá-lo e para quem ele é indicado.

Principais conclusões

  • O LoRAX (github.com/predibase/lorax) é um servidor de inferência multi-LoRA gratuito, de código aberto e autogerenciado
  • Criado pela Predibase, uma empresa de plataforma de ML fundada em 2021 por ex-funcionários do Google e da Uber; a Rubrik anunciou a aquisição da Predibase em 25 de junho de 2025
  • Licenciado sob Apache 2.0, descrito pelo projeto como gratuito para uso comercial
  • Fork do text-generation-inference da Hugging Face (a partir da v0.9.4), depois estendido com carregamento dinâmico de múltiplos adaptadores LoRA
  • Requer uma GPU NVIDIA, geração Ampere ou mais recente, CUDA 11.8+, no Linux
  • Suporta adaptadores treinados com PEFT ou Ludwig; carrega-os do HuggingFace Hub, da Predibase ou de um caminho do sistema de arquivos local
  • Mais de 3.800 estrelas no GitHub e mais de 324 forks no momento desta análise

📍 Em uma frase

O LoRAX é um servidor de inferência gratuito, de código aberto (Apache 2.0) e autogerenciado, fork do text-generation-inference da Hugging Face, desenvolvido pela Predibase (adquirida pela Rubrik em 2025), que serve milhares de adaptadores LoRA ajustados sobre um único modelo base compartilhado em uma única GPU, com mais de 3.800 estrelas no GitHub.

💬 Em termos simples

Em vez de rodar um modelo hospedado em uma GPU separada para cada variante ajustada do seu LLM base, o LoRAX carrega uma única cópia compartilhada do modelo base e troca dinamicamente pequenos pesos de adaptadores LoRA por requisição — assim, uma única GPU pode servir simultaneamente várias "personalidades" ajustadas diferentes do mesmo modelo, por uma fração do custo de uma GPU por modelo.

📌Nota: Esta análise se baseia no próprio repositório GitHub, README e notas de versão do LoRAX. Não afirma que a PromptQuorum tenha comparado de forma independente seu throughput ou latência com outros servidores de inferência — consulte a documentação própria do projeto para números de desempenho atuais antes de uma decisão de dimensionamento em produção.

O que é o LoRAX?

O LoRAX ("LoRA eXchange") é um servidor de inferência autogerenciado criado especificamente para servir muitos adaptadores LoRA ajustados sobre um único modelo base compartilhado, em vez de exigir uma implantação de modelo dedicada por ajuste fino. Segundo seu próprio posicionamento, é "o framework de código aberto para servir centenas de LLMs ajustados em produção pelo preço de um".

  • Tipo de produto: um servidor de inferência autogerenciado (CLI + biblioteca), não uma API hospedada nem um aplicativo de desktop
  • Criadora: Predibase, fundada em 2021 por ex-funcionários do Google e da Uber como empresa de plataforma de ML
  • Situação corporativa: a Rubrik, uma empresa de segurança de dados, anunciou o acordo para adquirir a Predibase em 25 de junho de 2025; a plataforma comercial da Predibase agora está posicionada sob a Rubrik, enquanto o projeto de código aberto LoRAX continua publicado no GitHub sob a organização Predibase
  • Fundação: fork do text-generation-inference da Hugging Face (a partir da v0.9.4), depois estendido especificamente para servir múltiplos adaptadores de forma dinâmica
  • Licença: Apache 2.0, confirmada pelo repositório GitHub
  • Escala: mais de 3.800 estrelas no GitHub e mais de 324 forks no momento desta análise

Histórico do projeto e marcos de versão

O LoRAX tem sido desenvolvido continuamente desde seus primeiros lançamentos no início de 2024, adicionando a cada versão suporte mais amplo a modelos, opções de quantização e recursos de serviço. Os números de versão e datas abaixo vêm das próprias notas de versão do projeto no GitHub; consulte a página de lançamentos diretamente para qualquer coisa lançada após a data de publicação desta análise.

  1. 1
    v0.6.0 — 10 de janeiro de 2024: API compatível com OpenAI
    Why it matters: Adicionou endpoints de completions e chat-completions compatíveis com OpenAI, permitindo que código cliente OpenAI existente aponte para um servidor LoRAX autogerenciado.
  2. 2
    v0.7.0 — 1º de fevereiro de 2024: fusão de múltiplos adaptadores, quantização EETQ/HQQ
    Why it matters: Permitiu fundir vários adaptadores LoRA por requisição usando métodos linear, TIES e DARE, e adicionou dois formatos de quantização a mais.
  3. 3
    v0.8.0–v0.8.1 — fevereiro de 2024: saída estruturada e suporte ao Gemma
    Why it matters: Adicionou saída estruturada guiada por esquema JSON via biblioteca Outlines, além de suporte para a família de modelos Gemma do Google.
  4. 4
    v0.9.0 — 23 de março de 2024: memória dedicada para adaptadores, suporte ao Qwen2
    Why it matters: Segundo as notas de versão, reservou memória de GPU dedicada para adaptadores e adicionou suporte aos modelos Qwen2.
  5. 5
    v0.10.0 — 23 de maio de 2024: decodificação especulativa Medusa
    Why it matters: Adicionou adaptadores de decodificação especulativa Medusa e suporte aos modelos Phi-3, Command-R e DBRX, visando geração mais rápida.
  6. 6
    v0.11.0 — 18 de setembro de 2024: cache de prefixo, suporte a visão-linguagem
    Why it matters: Adicionou cache de prefixo para prompts repetidos, suporte ao modelo de visão-linguagem Llava-Next, e quantização FP8 para os modelos Mistral e Llama.
  7. 7
    v0.12.0 — 6 de novembro de 2024: cache de prefixo multi-LoRA, chamada de funções
    Why it matters: Segundo o changelog, estendeu o cache de prefixo para funcionar em vários adaptadores simultaneamente, adicionou suporte a cache KV em FP8 e chamada de funções com aplicação de esquema — o marco mais recente que esta análise conseguiu confirmar a partir das notas de versão públicas.

O que o LoRAX realmente faz?

O LoRAX carrega um modelo base compartilhado na memória da GPU e, em seguida, carrega e troca dinamicamente pequenos pesos de adaptadores LoRA a cada requisição recebida, de modo que muitas variantes de modelo ajustadas podem ser servidas a partir de uma única implantação.

  • Carregamento dinâmico de adaptadores — os adaptadores LoRA são carregados sob demanda por requisição, em vez de exigir que cada adaptador esteja pré-carregado, com pré-busca assíncrona e descarregamento entre memória de GPU e CPU para gerenciar quais adaptadores permanecem "ativos"
  • Processamento em lote contínuo heterogêneo — agrupa, segundo sua própria descrição de arquitetura, requisições direcionadas a diferentes adaptadores no mesmo lote, em vez de exigir um lote por adaptador
  • Suporte a modelos base — compatível com Llama, CodeLlama, Mistral, Zephyr, Qwen, Gemma, Phi-3, Command-R, DBRX, e os modelos de visão-linguagem Mllama/Llava-Next, segundo suas notas de versão
  • Opções de quantização — fp16, ou quantizado com bitsandbytes, GPT-Q, AWQ, EETQ ou HQQ, além de suporte a cache KV em FP8 adicionado em versões posteriores
  • Compatibilidade de adaptadores — funciona com adaptadores treinados via PEFT ou Ludwig, carregados do HuggingFace Hub, da Predibase ou de um caminho do sistema de arquivos local
  • API compatível com OpenAI — expõe endpoints de chat-completions e completions no formato de requisição/resposta da OpenAI, permitindo que código cliente OpenAI existente aponte para um servidor LoRAX autogerenciado
  • Recursos de infraestrutura de serviço — paralelismo de tensores, flash-attention, paged attention, streaming de tokens, métricas Prometheus e rastreamento OpenTelemetry, segundo sua documentação
  • Saída estruturada — geração guiada por esquema JSON via biblioteca Outlines, além de chamada de funções com aplicação de esquema em versões posteriores

Exemplos de uso: três formas de usar o LoRAX

Estes são fluxos de trabalho concretos construídos a partir dos próprios recursos documentados do LoRAX, não casos de uso hipotéticos.

Plataforma, preços e licenciamento

Plataforma

O que o LoRAX informa:
Autogerenciado, somente Linux; requer uma GPU NVIDIA, geração Ampere ou mais recente, com CUDA 11.8+.

Custo

O que o LoRAX informa:
Gratuito e de código aberto, descrito como gratuito para uso comercial. Você paga apenas pela sua própria infraestrutura de GPU — não existe um nível pago separado do LoRAX.

Licenciamento

O que o LoRAX informa:
Apache 2.0, confirmada pelo repositório GitHub.

Método de instalação

O que o LoRAX informa:
Imagem Docker (ghcr.io/predibase/lorax:main), além de caminhos de implantação documentados para Kubernetes e SkyPilot; o cliente Python é instalado separadamente via pip.

A Predibase (criadora do LoRAX, agora posicionada sob a Rubrik após sua aquisição em 2025) também vende separadamente uma plataforma comercial gerenciada construída sobre tecnologia relacionada — verifique os preços comerciais atuais diretamente com a Predibase/Rubrik se uma oferta gerenciada, em vez de autogerenciamento, for o que você precisa.

LoRAX vs. um motor de inferência genérico

O LoRAX e um motor de inferência genérico como LMDeploy ou NVIDIA Dynamo servem LLMs em larga escala, mas o LoRAX é construído especificamente em torno de um problema específico: servir muitos adaptadores LoRA em um único modelo base de forma econômica.

Aspecto
LoRAX
Motor de inferência genérico
Função principalServe muitos adaptadores LoRA em um modelo baseServe um ou mais modelos completos com alto throughput
Processamento em lote multi-adaptadorProcessamento em lote contínuo heterogêneo embutidoNormalmente não é um foco central
BaseFork do text-generation-inference da Hugging FaceVaria conforme o projeto
API compatível com OpenAISimFrequentemente sim
Melhor usoMuitas variantes ajustadas de um modelo baseMenos modelos, máximo throughput bruto

Se sua carga de trabalho é servir muitas variantes ajustadas do mesmo modelo base (adaptadores por cliente ou por tarefa), o processamento em lote focado em adaptadores do LoRAX foi construído exatamente para isso. Se você serve um pequeno número de modelos completos distintos com throughput bruto máximo, sem necessidade de troca de adaptadores, um motor genérico pode se encaixar melhor — verifique benchmarks atuais nos sites de ambos os projetos antes de escolher, já que os dois lançam melhorias de desempenho com frequência.

Quem deveria usar o LoRAX?

O LoRAX é indicado para equipes que têm, ou planejam ter, muitos adaptadores LoRA ajustados do mesmo modelo base e querem servi-los de forma econômica a partir de capacidade de GPU compartilhada.

Para que o LoRAX não é indicado

O LoRAX não é uma boa escolha se você precisa de implantação somente CPU ou fora do Linux, treinamento de adaptadores em vez de servi-los, ou uma plataforma hospedada totalmente gerenciada.

  • Não é somente CPU — requer uma GPU NVIDIA, geração Ampere ou mais recente, com CUDA 11.8+; não há modo de fallback para CPU
  • Não é multiplataforma para o servidor em si — o servidor do LoRAX roda apenas no Linux, segundo sua própria documentação
  • Não é uma ferramenta de treinamento — o LoRAX serve adaptadores LoRA já treinados em outro lugar (via PEFT, Ludwig ou similar); ele não faz o ajuste fino dos modelos por conta própria
  • Não é um serviço hospedado gerenciado por si só — é um software de código aberto autogerenciado; a plataforma comercial separada da Predibase (agora posicionada sob a Rubrik após sua aquisição em 2025) é a opção gerenciada, se você quiser uma
  • Não testado de forma independente pela PromptQuorum quanto a throughput ou latência — esta análise se baseia na documentação e nas notas de versão do próprio LoRAX, não em testes práticos

Erros comuns ao avaliar o LoRAX

A maior parte da confusão em torno do LoRAX vem de esperar que ele treine adaptadores, que rode sem GPU, ou de presumir que seu apoio corporativo permanece inalterado após a aquisição da Predibase.

Concorrentes e alternativas

O LoRAX é mais frequentemente comparado a outras ferramentas autogerenciadas de inferência e fine-tuning, pois fica na interseção entre os segmentos de serviço de inferência e ajuste fino LoRA. Complementar à própria entrada do LoRAX no Diretório de Software LLM Local.

Tool
Best known for
Link
LMDeployMotor de inferência de código aberto com kit de quantização e serviçoAnálise do LMDeploy
NVIDIA DynamoFramework de serviço de inferência de alto throughput com recursos de servidor de APIAnálise do NVIDIA Dynamo
UnslothBiblioteca de fine-tuning LoRA/QLoRA rápida e eficiente em memóriaAnálise do Unsloth
LLaMA-FactoryFramework de fine-tuning unificado com suporte a LoRA e outros métodos PEFTAnálise do LLaMA-Factory

Esta lista reflete ferramentas do mesmo segmento de serviço de inferência e fine-tuning LoRA que o LoRAX, não um ranking independente da PromptQuorum — verifique o conjunto de recursos atual de cada ferramenta antes de escolher, já que o foco do LoRAX em servir múltiplos adaptadores não é idêntico ao de um motor de inferência genérico ou de uma ferramenta apenas de treinamento.

Perguntas frequentes

O que é o LoRAX?

O LoRAX ("LoRA eXchange", github.com/predibase/lorax) é um servidor de inferência gratuito, de código aberto e autogerenciado que serve muitos adaptadores LoRA ajustados sobre um único modelo base compartilhado em uma única GPU.

O LoRAX é gratuito?

Sim, o LoRAX em si é gratuito, de código aberto (Apache 2.0), e descrito pelo projeto como gratuito para uso comercial. Você paga apenas pela sua própria infraestrutura de GPU para executá-lo.

Quem criou o LoRAX?

O LoRAX foi criado pela Predibase, uma empresa de plataforma de ML fundada em 2021 por ex-funcionários do Google e da Uber. A Rubrik, uma empresa de segurança de dados, anunciou o acordo para adquirir a Predibase em 25 de junho de 2025.

Qual GPU o LoRAX requer?

Uma GPU NVIDIA, geração Ampere ou mais recente, com CUDA 11.8+, no Linux. Não há modo somente CPU nem implantação nativa do servidor em macOS/Windows.

Como instalo o LoRAX?

Como servidor autogerenciado via a imagem Docker (ghcr.io/predibase/lorax:main), com caminhos de implantação em Kubernetes e SkyPilot também documentados. O cliente Python é instalado separadamente via pip install lorax-client.

Quais modelos base o LoRAX suporta?

Segundo suas notas de versão: Llama, CodeLlama, Mistral, Zephyr, Qwen, Gemma, Phi-3, Command-R, DBRX, e os modelos de visão-linguagem Mllama/Llava-Next, entre outros — consulte a documentação atual para a lista completa e atualizada.

O LoRAX treina adaptadores LoRA?

Não. O LoRAX é um servidor de inferência que serve adaptadores já treinados em outro lugar via PEFT, Ludwig ou ferramentas semelhantes. Combine-o com uma ferramenta de fine-tuning dedicada como Unsloth ou LLaMA-Factory se precisar produzir os adaptadores primeiro.

O LoRAX tem uma API compatível com OpenAI?

Sim. O LoRAX expõe endpoints de chat-completions e completions no formato de requisição/resposta da OpenAI, permitindo que código cliente OpenAI existente aponte para um servidor LoRAX autogerenciado.

Quais formatos de quantização o LoRAX suporta?

fp16, além de quantização via bitsandbytes, GPT-Q, AWQ, EETQ ou HQQ, e suporte a cache KV em FP8 adicionado em versões posteriores, segundo suas notas de versão.

A PromptQuorum testou de forma independente as alegações de desempenho do LoRAX?

Esta análise se baseia no próprio repositório GitHub, README e notas de versão do LoRAX, não em benchmarking prático realizado pela PromptQuorum. Verifique os números atuais de throughput e latência diretamente na documentação própria do projeto antes de uma decisão de dimensionamento em produção.

Fontes

← Voltar para LLMs locais avançados