Conclusiones clave
- Licencia MIT, creado por un desarrollador conocido como turboderp
- Unas 4.600 estrellas en GitHub; el repositorio en github.com/turboderp-org/exllamav2 está marcado como archivado
- Formato de cuantización EXL2: mezcla precisión de 2, 3, 4, 5, 6 y 8 bits por capa para alcanzar una tasa de bits promedio objetivo, por ejemplo, ejecutar un modelo de 70B en 24 GB de VRAM a aproximadamente 2,55 bits por peso
- El proyecto sucesor ExLlamaV3 (unas 1.300 estrellas en GitHub) introduce el formato EXL3, una variante simplificada del enfoque de cuantización QTIP de Cornell RelaxML
- TabbyAPI, un servidor basado en FastAPI, es la capa de API compatible con OpenAI recomendada para ambas versiones
- También integrado en text-generation-webui, lollms-webui y la interfaz web independiente ExUI
📍 En una frase
ExLlamaV2 es una biblioteca de inferencia gratuita con licencia MIT de turboderp's para inferencia rápida de LLM en GPU NVIDIA de consumo, conocida por su flexible formato de cuantización EXL2, pero su repositorio ahora está archivado en favor del sucesor activamente desarrollado, ExLlamaV3.
💬 En términos simples
ExLlamaV2 se construyó específicamente para exprimir la máxima velocidad de una sola GPU de consumo mediante un esquema de cuantización inusualmente flexible; su propio mantenedor ha trasladado desde entonces el desarrollo a un nuevo proyecto, ExLlamaV3, en lugar de seguir actualizando V2.
📌Nota: El propio README de GitHub de ExLlamaV2 indica que el proyecto está archivado y que el desarrollo continúa en ExLlamaV3 — cualquiera que inicie un nuevo proyecto hoy debería evaluar ExLlamaV3 en lugar de construir sobre la base de código archivada de V2.
¿Qué era ExLlamaV2?
ExLlamaV2 era una biblioteca de inferencia gratuita y de código abierto, publicada bajo licencia MIT por un desarrollador conocido como turboderp, diseñada específicamente para maximizar la velocidad de inferencia en GPU NVIDIA de consumo. Sucedió a un proyecto anterior, ExLlama, y era en sí misma una reescritura más eficiente en memoria centrada en ejecutar modelos cuantizados rápidamente en una sola GPU.
El repositorio, github.com/turboderp-org/exllamav2, alcanzó unas 4.600 estrellas en GitHub antes de ser marcado como archivado, con su README señalando a ExLlamaV3 como el proyecto donde el desarrollo continúa ahora.
- Centrado estrechamente en GPU NVIDIA de consumo en lugar de la amplia cobertura de hardware de motores como llama.cpp
- Introdujo el formato de cuantización EXL2 como su principal aporte técnico, permitiendo cuantización de precisión mixta dentro de un mismo modelo
- Soportaba los mismos modelos GPTQ de 4 bits que el ExLlama original, además de su propio formato EXL2
- Instalable vía pip (
pip install exllamav2), wheels precompilados, o compilando desde el código fuente con el CUDA Toolkit
¿Qué es la cuantización EXL2?
EXL2 es el formato de cuantización de ExLlamaV2, que permite que diferentes capas lineales dentro del mismo modelo usen distintos anchos de bits — de 2 a 8 bits — elegidos automáticamente a partir de datos de calibración para alcanzar una tasa de bits promedio objetivo. Esto es más flexible que un único ancho de bits fijo aplicado uniformemente a todo un modelo.
- Soporta niveles de cuantización de 2, 3, 4, 5, 6 y 8 bits, mezclados por capa dentro de un mismo modelo
- Las columnas de pesos más importantes pueden cuantizarse con mayor precisión mientras las menos importantes usan menos bits, en un principio similar a la cuantización dispersa
- Permite una compresión extrema para modelos grandes con VRAM limitada — pruebas documentadas muestran un modelo de 70.000 millones de parámetros ejecutándose en 24 GB de VRAM a aproximadamente 2,55 bits por peso con un contexto de 2048 tokens
- Los parámetros de cuantización se eligen automáticamente a partir de datos de calibración en lugar de requerir configuración manual por capa
¿Por qué está archivado ExLlamaV2, y qué cambia ExLlamaV3?
El repositorio turboderp-org/exllamav2 está marcado como archivado, y su propio README indica que el desarrollo continúa en ExLlamaV3. Este es el hecho más importante que hay que conocer antes de evaluar ExLlamaV2 para un nuevo proyecto.
ExLlamaV3 introduce su propio formato, EXL3, descrito como una variante simplificada del enfoque de cuantización QTIP de Cornell RelaxML. A diferencia de EXL2, EXL3 conserva las estructuras de tensores originales en lugar de renombrarlas, con la intención de facilitar el soporte futuro de otros frameworks. ExLlamaV3 documenta CUDA 12.4 o posterior como requisito y sus propios mantenedores lo señalan explícitamente como aún en maduración — hay que esperar algunas asperezas.
- ExLlamaV2: archivado, licencia MIT, formato EXL2, aún instalable pero sin recibir más desarrollo
- ExLlamaV3: activo, licencia MIT, formato EXL3 (basado en investigación QTIP), estabilidad beta según su propia documentación
- Ambos están mantenidos por el mismo desarrollador, turboderp, bajo la organización de GitHub turboderp-org
📌Nota: Para cualquier despliegue nuevo, evalúe primero ExLlamaV3 — es donde está ocurriendo el mantenimiento activo y las mejoras. ExLlamaV2 sigue siendo relevante principalmente para configuraciones existentes ya construidas sobre él, o para archivos de modelos cuantizados EXL2 ya en circulación.
¿Cómo se instala y ejecuta ExLlamaV2 (o V3)?
ExLlamaV2 se instala vía pip, wheels precompilados, o desde el código fuente con el CUDA Toolkit; ExLlamaV3 sigue un patrón similar. TabbyAPI es la forma recomendada de tener un servidor compatible con OpenAI funcionando sobre cualquiera de los dos.
- 1Para ExLlamaV2: instale vía
pip install exllamav2, o descargue un wheel precompilado que coincida con su versión de Python y CUDA desde la página de GitHub Releases, o clone y compile desde el código fuente con el CUDA Toolkit instalado. - 2Para ExLlamaV3 (recomendado para instalaciones nuevas): siga las rutas de instalación equivalentes documentadas en github.com/turboderp-org/exllamav3, teniendo en cuenta que se requiere CUDA 12.4 o posterior.
- 3Descargue un modelo EXL2 (o EXL3) precuantizado, comúnmente publicado en Hugging Face por cuantizadores de la comunidad.
- 4Instale y ejecute TabbyAPI, el servidor basado en FastAPI recomendado, para exponer un endpoint de API compatible con OpenAI con descarga de modelos de HF y soporte de plantillas de chat Jinja2.
- 5Alternativamente, use ExLlamaV2/V3 a través de una integración existente — text-generation-webui, lollms-webui, o la interfaz web independiente ExUI — en lugar de ejecutar TabbyAPI directamente.
¿Puedo seguir usando ExLlamaV2 hoy?
Sí, sigue siendo instalable y funcional, pero el repositorio está archivado y no recibirá más actualizaciones, correcciones de errores ni funciones nuevas.
¿Funcionan los archivos de modelo EXL2 con ExLlamaV3?
No, no directamente — ExLlamaV3 usa su propio formato de cuantización EXL3. Los archivos de modelo EXL2 existentes están hechos para configuraciones de ExLlamaV2/TabbyAPI, no para V3.
¿Qué hardware requiere ExLlamaV2?
ExLlamaV2 se dirige específicamente a GPU NVIDIA de consumo — no existe ninguna vía de soporte para AMD, Intel, o solo CPU. Este enfoque estrecho en hardware es parte de lo que le permitió optimizarse tan intensamente para la velocidad en una sola GPU.
- Solo GPU NVIDIA, se requiere CUDA — sin soporte documentado para AMD, Intel, o Apple Silicon
- Diseñado en torno a tarjetas de consumo en lugar de GPU de centro de datos, aunque también funciona en estas
- Los requisitos de VRAM escalan con el tamaño del modelo y la tasa de bits EXL2 elegida — precisamente la cuantización flexible es lo que permite que modelos grandes quepan en relativamente poca VRAM
- ExLlamaV3 documenta CUDA 12.4 o posterior como requisito, una base más reciente que la que asumía ExLlamaV2
¿Quién debería usar ExLlamaV2 (o ExLlamaV3)?
Usa ExLlamaV3 para un proyecto nuevo si exprimir la máxima velocidad y eficiencia de VRAM de una sola GPU NVIDIA de consumo importa más que un amplio soporte de hardware o garantías de estabilidad a largo plazo; hoy hay pocas razones para iniciar un proyecto totalmente nuevo sobre el archivado ExLlamaV2.
¿Cómo se compara ExLlamaV2 con las alternativas?
Las comparaciones más cercanas de ExLlamaV2 son su propio sucesor y otros motores con un fuerte enfoque en cuantización o velocidad en una sola GPU.
Herramienta | Licencia | Mejor para |
|---|---|---|
| ExLlamaV2 (archivado) | MIT | Solo configuraciones EXL2 existentes |
| ExLlamaV3 | MIT | Máxima eficiencia de cuantización en una GPU (beta) |
| llama.cpp | MIT | Soporte de hardware más amplio, control directo |
| Ollama | MIT | Configuración local más simple |
| KoboldCpp | AGPL 3.0 | Sin instalación, UI de rol/historias |
Errores comunes al evaluar ExLlamaV2
La mayor confusión surge de no darse cuenta de que el proyecto está archivado, o de esperar compatibilidad cruzada entre archivos de modelo EXL2 y EXL3.
Preguntas frecuentes
¿Se sigue manteniendo ExLlamaV2?
No. El repositorio de GitHub turboderp-org/exllamav2 está marcado como archivado, y su README indica que el desarrollo continúa en ExLlamaV3.
¿Qué es EXL2?
EXL2 es el formato de cuantización de ExLlamaV2, que soporta precisión mixta de 2 a 8 bits por capa dentro de un mismo modelo para alcanzar una tasa de bits promedio objetivo, permitiendo que modelos grandes quepan en menos VRAM.
¿Qué es ExLlamaV3, y en qué se diferencia?
ExLlamaV3 es el sucesor activamente desarrollado de ExLlamaV2, que usa un nuevo formato de cuantización EXL3 basado en el enfoque QTIP de Cornell RelaxML. Sus propios mantenedores lo documentan como software en fase beta.
¿Quién creó ExLlamaV2 y ExLlamaV3?
Ambos fueron creados por un desarrollador conocido como turboderp, bajo la organización de GitHub turboderp-org.
¿Es gratuito ExLlamaV2?
Sí. Tanto ExLlamaV2 como ExLlamaV3 se publican bajo licencia MIT, gratis para uso personal y comercial.
¿Soporta ExLlamaV2 GPU AMD?
No. Tanto ExLlamaV2 como ExLlamaV3 requieren una GPU NVIDIA con CUDA — no hay soporte para AMD, Intel, o Apple Silicon.
¿Qué es TabbyAPI?
TabbyAPI es un servidor basado en FastAPI y la forma recomendada de exponer una API compatible con OpenAI sobre ExLlamaV2 o ExLlamaV3, con funciones adicionales como descarga de modelos de Hugging Face y soporte de plantillas de chat Jinja2.
¿Se pueden usar indistintamente los archivos de modelo EXL2 y EXL3?
No. Los archivos EXL2 están cuantizados para ExLlamaV2 y no son directamente compatibles con ExLlamaV3, que usa el formato EXL3 independiente.
¿Debería usar ExLlamaV2 o ExLlamaV3 para un proyecto nuevo?
ExLlamaV3, ya que ExLlamaV2 está archivado y no recibe más desarrollo. ExLlamaV3 sigue en fase beta, así que hay que esperar algunas asperezas en comparación con un proyecto maduro y activamente estabilizado.
¿Cómo se compara ExLlamaV2 con llama.cpp?
llama.cpp soporta una gama de hardware mucho más amplia (NVIDIA, AMD, Apple Silicon, Intel, solo CPU) y se mantiene activamente; ExLlamaV2 estaba centrado estrechamente en GPU NVIDIA de consumo y ahora está archivado, con ExLlamaV3 como su sucesor activo.
