Conclusiones clave
- LoRAX (github.com/predibase/lorax) es un servidor de inferencia multi-LoRA gratuito, de código abierto y autoalojado
- Creado por Predibase, una empresa de plataformas de ML fundada en 2021 por exempleados de Google y Uber; Rubrik anunció la adquisición de Predibase el 25 de junio de 2025
- Con licencia Apache 2.0, descrito por el proyecto como gratuito para uso comercial
- Fork de text-generation-inference de Hugging Face (a partir de la v0.9.4), luego ampliado con carga dinámica de múltiples adaptadores LoRA
- Requiere una GPU NVIDIA, generación Ampere o posterior, CUDA 11.8+, en Linux
- Admite adaptadores entrenados con PEFT o Ludwig; los carga desde HuggingFace Hub, Predibase o una ruta del sistema de archivos local
- Más de 3.800 estrellas en GitHub y más de 324 forks al momento de este análisis
📍 En una frase
LoRAX es un servidor de inferencia gratuito, de código abierto (Apache 2.0) y autoalojado, fork de text-generation-inference de Hugging Face, creado por Predibase (adquirida por Rubrik en 2025), que sirve miles de adaptadores LoRA afinados sobre un único modelo base compartido en una sola GPU, con más de 3.800 estrellas en GitHub.
💬 En términos simples
En lugar de ejecutar un modelo alojado en una GPU independiente para cada variante afinada de tu LLM base, LoRAX carga una única copia compartida del modelo base e intercambia dinámicamente pequeños pesos de adaptadores LoRA por solicitud, de modo que una sola GPU puede servir a la vez muchas "personalidades" afinadas distintas del mismo modelo, a una fracción del coste de una GPU por modelo.
📌Nota: Este análisis se basa en el propio repositorio de GitHub, el README y las notas de versión de LoRAX. No afirma que PromptQuorum haya comparado de forma independiente su rendimiento o latencia frente a otros servidores de inferencia — consulta la documentación propia del proyecto para conocer las cifras de rendimiento actuales antes de tomar una decisión de dimensionamiento en producción.
¿Qué es LoRAX?
LoRAX ("LoRA eXchange") es un servidor de inferencia autoalojado creado específicamente para servir muchos adaptadores LoRA afinados sobre un único modelo base compartido, en lugar de requerir un despliegue de modelo dedicado por cada ajuste fino. Según su propio posicionamiento, es "el framework de código abierto para servir cientos de LLM afinados en producción al precio de uno".
- Tipo de producto: un servidor de inferencia autoalojado (CLI + biblioteca), no una API alojada ni una aplicación de escritorio
- Creador: Predibase, fundada en 2021 por exempleados de Google y Uber como empresa de plataformas de ML
- Situación corporativa: Rubrik, una empresa de seguridad de datos, anunció su acuerdo para adquirir Predibase el 25 de junio de 2025; la plataforma comercial de Predibase ahora está bajo Rubrik, mientras que el proyecto de código abierto LoRAX sigue publicándose en GitHub bajo la organización Predibase
- Base: fork de text-generation-inference de Hugging Face (a partir de la v0.9.4), luego ampliado específicamente para servir múltiples adaptadores de forma dinámica
- Licencia: Apache 2.0, confirmada a través del repositorio de GitHub
- Escala: más de 3.800 estrellas en GitHub y más de 324 forks al momento de este análisis
Historia del proyecto e hitos de versiones
LoRAX se ha desarrollado de forma continua desde sus primeras versiones de principios de 2024, añadiendo con cada versión un soporte de modelos más amplio, opciones de cuantización y funciones de servicio. Los números de versión y fechas de abajo provienen de las propias notas de versión de GitHub del proyecto; consulta la página de lanzamientos directamente para cualquier novedad posterior a la fecha de publicación de este análisis.
- 1v0.6.0 — 10 de enero de 2024: API compatible con OpenAI
Why it matters: Añadió endpoints de completions y chat-completions compatibles con OpenAI, permitiendo que el código cliente de OpenAI existente apunte a un servidor LoRAX autoalojado. - 2v0.7.0 — 1 de febrero de 2024: fusión de múltiples adaptadores, cuantización EETQ/HQQ
Why it matters: Permitió fusionar varios adaptadores LoRA por solicitud usando métodos lineales, TIES y DARE, y añadió dos formatos de cuantización adicionales. - 3v0.8.0–v0.8.1 — febrero de 2024: salida estructurada y soporte de Gemma
Why it matters: Añadió salida estructurada guiada por esquema JSON mediante la biblioteca Outlines, además de soporte para la familia de modelos Gemma de Google. - 4v0.9.0 — 23 de marzo de 2024: memoria dedicada para adaptadores, soporte de Qwen2
Why it matters: Según las notas de versión, reservó memoria de GPU dedicada para adaptadores y añadió soporte para modelos Qwen2. - 5v0.10.0 — 23 de mayo de 2024: decodificación especulativa Medusa
Why it matters: Añadió adaptadores de decodificación especulativa Medusa y soporte para los modelos Phi-3, Command-R y DBRX, orientado a una generación más rápida. - 6v0.11.0 — 18 de septiembre de 2024: caché de prefijos, soporte de visión-lenguaje
Why it matters: Añadió caché de prefijos para prompts repetidos, soporte del modelo de visión-lenguaje Llava-Next, y cuantización FP8 para modelos Mistral y Llama. - 7v0.12.0 — 6 de noviembre de 2024: caché de prefijos multi-LoRA, llamadas a funciones
Why it matters: Según el changelog, extendió la caché de prefijos para funcionar en varios adaptadores simultáneamente, añadió soporte de caché KV en FP8 y llamadas a funciones con aplicación de esquema — el hito más reciente que este análisis pudo confirmar a partir de las notas de versión públicas.
¿Qué hace realmente LoRAX?
LoRAX carga un modelo base compartido en la memoria de la GPU y luego carga e intercambia dinámicamente pequeños pesos de adaptadores LoRA por cada solicitud entrante, de modo que se pueden servir muchas variantes de modelo afinadas desde un único despliegue.
- Carga dinámica de adaptadores — los adaptadores LoRA se cargan bajo demanda por solicitud en lugar de requerir que cada adaptador esté precargado, con precarga asíncrona y descarga entre memoria de GPU y CPU para gestionar qué adaptadores permanecen activos
- Procesamiento por lotes continuo heterogéneo — agrupa, según su propia descripción arquitectónica, solicitudes dirigidas a distintos adaptadores en el mismo lote, en lugar de requerir un lote por adaptador
- Soporte de modelos base — compatible con Llama, CodeLlama, Mistral, Zephyr, Qwen, Gemma, Phi-3, Command-R, DBRX, y los modelos de visión-lenguaje Mllama/Llava-Next, según sus notas de versión
- Opciones de cuantización — fp16, o cuantizado con bitsandbytes, GPT-Q, AWQ, EETQ o HQQ, más soporte de caché KV en FP8 añadido en versiones posteriores
- Compatibilidad de adaptadores — funciona con adaptadores entrenados vía PEFT o Ludwig, cargados desde HuggingFace Hub, Predibase o una ruta del sistema de archivos local
- API compatible con OpenAI — expone endpoints de chat-completions y completions en el formato de solicitud/respuesta de OpenAI, permitiendo que el código cliente de OpenAI existente apunte a un servidor LoRAX autoalojado
- Funciones de infraestructura de servicio — paralelismo de tensores, flash-attention, paged attention, streaming de tokens, métricas de Prometheus y trazado con OpenTelemetry, según su documentación
- Salida estructurada — generación guiada por esquema JSON mediante la biblioteca Outlines, además de llamadas a funciones con aplicación de esquema en versiones posteriores
Ejemplos de uso: tres formas de usar LoRAX
Estos son flujos de trabajo concretos basados en las propias funciones documentadas de LoRAX, no casos de uso hipotéticos.
Plataforma, precios y licencia
Plataforma
- Lo que indica LoRAX:
- Autoalojado, solo Linux; requiere una GPU NVIDIA, generación Ampere o posterior, con CUDA 11.8+.
Coste
- Lo que indica LoRAX:
- Gratuito y de código abierto, descrito como gratuito para uso comercial. Solo pagas por tu propia infraestructura de GPU — no existe un nivel de pago independiente de LoRAX.
Licencia
- Lo que indica LoRAX:
- Apache 2.0, confirmada a través del repositorio de GitHub.
Método de instalación
- Lo que indica LoRAX:
- Imagen Docker (
ghcr.io/predibase/lorax:main), además de rutas de despliegue documentadas para Kubernetes y SkyPilot; el cliente de Python se instala por separado vía pip.
Predibase (creador de LoRAX, ahora bajo Rubrik tras su adquisición en 2025) también vende por separado una plataforma comercial gestionada construida sobre tecnología relacionada — verifica los precios comerciales actuales directamente con Predibase/Rubrik si lo que necesitas es una oferta gestionada, en lugar de autoalojamiento.
Instalar LoRAX
LoRAX se ejecuta como servidor autoalojado vía Docker, Kubernetes o SkyPilot, con un cliente de Python independiente instalable vía pip.
Source | Link |
|---|---|
| Repositorio de GitHub (código fuente, Apache 2.0) | github.com/predibase/lorax |
| Imagen Docker | docker pull ghcr.io/predibase/lorax:main |
| Cliente de Python | pip install lorax-client |
| Documentación | loraexchange.ai |
LoRAX requiere una GPU NVIDIA (generación Ampere o posterior) con CUDA 11.8+ en Linux — no hay modo solo CPU ni una ruta de instalación nativa para macOS/Windows. Consulta siempre el README de GitHub para conocer el método de despliegue actualmente recomendado antes de ejecutar cualquier comando.
LoRAX frente a un motor de inferencia de propósito general
LoRAX y un motor de inferencia de propósito general como LMDeploy o NVIDIA Dynamo sirven LLM a gran escala, pero LoRAX está diseñado específicamente en torno a un problema concreto: servir muchos adaptadores LoRA sobre un único modelo base de forma económica.
Aspecto | LoRAX | Motor de inferencia de propósito general |
|---|---|---|
| Función principal | Sirve muchos adaptadores LoRA sobre un modelo base | Sirve uno o más modelos completos con alto rendimiento |
| Procesamiento por lotes multi-adaptador | Procesamiento por lotes continuo heterogéneo integrado | Normalmente no es un enfoque central |
| Base | Fork de text-generation-inference de Hugging Face | Varía según el proyecto |
| API compatible con OpenAI | Sí | A menudo sí |
| Mejor uso | Muchas variantes afinadas de un modelo base | Menos modelos, máximo rendimiento bruto |
Si tu carga de trabajo consiste en servir muchas variantes afinadas del mismo modelo base (adaptadores por cliente o por tarea), el procesamiento por lotes centrado en adaptadores de LoRAX está diseñado precisamente para eso. Si sirves un número reducido de modelos completos distintos con el máximo rendimiento bruto sin necesidad de intercambiar adaptadores, un motor de propósito general puede encajar mejor — verifica los benchmarks actuales en los sitios propios de ambos proyectos antes de elegir, ya que ambos publican mejoras de rendimiento con frecuencia.
¿Quién debería usar LoRAX?
LoRAX encaja en equipos que tienen, o planean tener, muchos adaptadores LoRA afinados del mismo modelo base y quieren servirlos de forma rentable desde capacidad de GPU compartida.
Para qué no es bueno LoRAX
LoRAX no es una buena opción si necesitas despliegue solo CPU o no Linux, entrenamiento de adaptadores en lugar de servirlos, o una plataforma alojada totalmente gestionada.
- No es solo CPU — requiere una GPU NVIDIA, generación Ampere o posterior, con CUDA 11.8+; no hay modo de respaldo por CPU
- No es multiplataforma para el servidor en sí — el servidor de LoRAX funciona solo en Linux, según su propia documentación
- No es una herramienta de entrenamiento — LoRAX sirve adaptadores LoRA ya entrenados en otro lugar (vía PEFT, Ludwig o similar); no afina modelos por sí mismo
- No es un servicio gestionado alojado por sí solo — es software de código abierto autoalojado; la plataforma comercial independiente de Predibase (ahora bajo Rubrik tras su adquisición en 2025) es la opción gestionada si quieres una
- No probado de forma independiente por PromptQuorum en rendimiento o latencia — este análisis se basa en la propia documentación y notas de versión de LoRAX, no en pruebas prácticas
Errores comunes al evaluar LoRAX
La mayor parte de la confusión sobre LoRAX proviene de esperar que entrene adaptadores, que funcione sin GPU, o de asumir que su respaldo corporativo no ha cambiado tras la adquisición de Predibase.
Competidores y alternativas
LoRAX se compara con mayor frecuencia con otras herramientas autoalojadas de inferencia y fine-tuning, ya que se sitúa en la intersección de los segmentos de servicio de inferencia y ajuste fino LoRA. Complementa la propia entrada de LoRAX en el Directorio de software LLM local.
Tool | Best known for | Link |
|---|---|---|
| LMDeploy | Motor de inferencia de código abierto con kit de cuantización y servicio | Análisis de LMDeploy |
| NVIDIA Dynamo | Framework de servicio de inferencia de alto rendimiento con funciones de servidor API | Análisis de NVIDIA Dynamo |
| Unsloth | Biblioteca de fine-tuning LoRA/QLoRA rápida y eficiente en memoria | Análisis de Unsloth |
| LLaMA-Factory | Framework de fine-tuning unificado que admite LoRA y otros métodos PEFT | Análisis de LLaMA-Factory |
Esta lista refleja herramientas del mismo segmento de servicio de inferencia y fine-tuning LoRA que LoRAX, no un ranking independiente de PromptQuorum — verifica el conjunto de funciones actual de cada herramienta antes de elegir, ya que el enfoque de LoRAX en servir múltiples adaptadores no es idéntico al de un motor de inferencia de propósito general o una herramienta solo de entrenamiento.
Preguntas frecuentes
¿Qué es LoRAX?
LoRAX ("LoRA eXchange", github.com/predibase/lorax) es un servidor de inferencia gratuito, de código abierto y autoalojado que sirve muchos adaptadores LoRA afinados sobre un único modelo base compartido en una sola GPU.
¿Es gratuito LoRAX?
Sí, LoRAX en sí es gratuito, de código abierto (Apache 2.0), y descrito por el proyecto como gratuito para uso comercial. Solo pagas por tu propia infraestructura de GPU para ejecutarlo.
¿Quién creó LoRAX?
LoRAX fue creado por Predibase, una empresa de plataformas de ML fundada en 2021 por exempleados de Google y Uber. Rubrik, una empresa de seguridad de datos, anunció su acuerdo para adquirir Predibase el 25 de junio de 2025.
¿Qué GPU requiere LoRAX?
Una GPU NVIDIA, generación Ampere o posterior, con CUDA 11.8+, en Linux. No hay modo solo CPU ni despliegue nativo del servidor en macOS/Windows.
¿Cómo instalo LoRAX?
Como servidor autoalojado vía la imagen Docker (ghcr.io/predibase/lorax:main), con rutas de despliegue en Kubernetes y SkyPilot también documentadas. El cliente de Python se instala por separado vía pip install lorax-client.
¿Qué modelos base admite LoRAX?
Según sus notas de versión: Llama, CodeLlama, Mistral, Zephyr, Qwen, Gemma, Phi-3, Command-R, DBRX, y los modelos de visión-lenguaje Mllama/Llava-Next, entre otros — consulta la documentación actual para la lista completa y actualizada.
¿Entrena LoRAX adaptadores LoRA?
No. LoRAX es un servidor de inferencia que sirve adaptadores ya entrenados en otro lugar vía PEFT, Ludwig o herramientas similares. Combínalo con una herramienta de fine-tuning dedicada como Unsloth o LLaMA-Factory si necesitas producir primero los adaptadores.
¿Tiene LoRAX una API compatible con OpenAI?
Sí. LoRAX expone endpoints de chat-completions y completions en el formato de solicitud/respuesta de OpenAI, permitiendo que el código cliente de OpenAI existente apunte a un servidor LoRAX autoalojado.
¿Qué formatos de cuantización admite LoRAX?
fp16, más cuantización vía bitsandbytes, GPT-Q, AWQ, EETQ o HQQ, y soporte de caché KV en FP8 añadido en versiones posteriores, según sus notas de versión.
¿Ha probado PromptQuorum de forma independiente las afirmaciones de rendimiento de LoRAX?
Este análisis se basa en el propio repositorio de GitHub, el README y las notas de versión de LoRAX, no en pruebas prácticas realizadas por PromptQuorum. Verifica las cifras actuales de rendimiento y latencia directamente en la documentación propia del proyecto antes de tomar una decisión de dimensionamiento en producción.