Conclusiones clave
- Licencia Apache 2.0; los propios cambios del proyecto a llama.cpp y whisper.cpp permanecen bajo MIT para seguir siendo upstreameables
- Alrededor de 25.900+ estrellas en GitHub en septiembre de 2026, repositorio en github.com/mozilla-ai/llamafile
- Creado por Justine Tunney, creadora de Cosmopolitan Libc, publicado por primera vez por el grupo de innovación de Mozilla en noviembre de 2023
- Un solo archivo ejecutable corre en macOS, Linux, BSD y Windows — Windows limita específicamente los ejecutables a 4 GB
- Aceleración por GPU disponible vía Metal (Apple Silicon), CUDA (NVIDIA), ROCm (AMD) y Vulkan
- Construido directamente sobre llama.cpp para la inferencia del modelo en sí, con Cosmopolitan Libc resolviendo el empaquetado multiplataforma
📍 En una frase
llamafile es un proyecto gratuito con licencia Apache 2.0, creado por Justine Tunney y publicado originalmente por Mozilla, que empaqueta un modelo y el motor llama.cpp en un único ejecutable que funciona sin modificación en macOS, Linux, Windows y BSD gracias a Cosmopolitan Libc.
💬 En términos simples
Descarga un archivo y haz doble clic — sin instalador, sin elegir un build específico de plataforma —, porque el propio archivo es válido en varios sistemas operativos a la vez, un truco posible gracias a Cosmopolitan Libc y no al empaquetado de varios builds separados por parte de llamafile.
📌Nota: La versión 0.10.0 introdujo un sistema de compilación reconstruido para mantener llamafile alineado con las versiones actuales de llama.cpp, y el soporte de CUDA para Linux se reintrodujo en febrero de 2026 tras un período de desincronización — revisa las notas de la versión para conocer el conjunto exacto de funciones de la versión descargada.
¿Qué es llamafile?
llamafile es un proyecto gratuito y de código abierto que empaqueta un modelo de lenguaje junto con el motor de inferencia llama.cpp en un único archivo ejecutable, distribuible y ejecutable sin instalación en varios sistemas operativos. Fue creado por Justine Tunney y publicado por primera vez por el grupo de innovación de Mozilla en noviembre de 2023.
El proyecto está alojado en github.com/mozilla-ai/llamafile (anteriormente bajo la organización Mozilla-Ocho) y ha superado unas 25.900 estrellas en GitHub. Se publica bajo licencia Apache 2.0, y los propios cambios del proyecto a llama.cpp y whisper.cpp permanecen bajo MIT para seguir siendo compatibles y upstreameables con esos proyectos.
- Combina un archivo de modelo y el motor llama.cpp en un único ejecutable distribuible, en lugar de requerir una instalación de motor separada más una descarga de modelo separada
- Se basa en llama.cpp para el trabajo de inferencia en sí — la propia contribución de llamafile es la capa de empaquetado y ejecución multiplataforma
- Por defecto, al ejecutarse lanza una interfaz web de chat, junto con un modo de servidor compatible con la API de OpenAI
- El proyecto y miembros de la comunidad publican en Hugging Face ejemplos de llamafiles precompilados para modelos abiertos populares
¿Qué es Cosmopolitan Libc, y cómo hace esto posible?
Cosmopolitan Libc es una biblioteca estándar de C, también creada por Justine Tunney, diseñada para compilar binarios "gordos" que son simultáneamente ejecutables válidos en varios sistemas operativos y arquitecturas de CPU. Esta es la tecnología subyacente que hace posible la distribución multiplataforma en un solo archivo de llamafile.
- Un binario construido con Cosmopolitan Libc puede correr, sin modificación, en macOS, Linux, BSD y Windows, en lugar de requerir un build compilado por separado para cada sistema operativo
- Esto difiere de empaquetar varios binarios específicos de plataforma en un solo archivo — es genuinamente un solo binario válido en varios sistemas
- Windows impone un límite de tamaño de archivo de 4 GB a los ejecutables, lo que limita cuán grande puede ser un solo llamafile específicamente en esa plataforma
- Cosmopolitan Libc es un proyecto separado y de propósito general; llamafile es una aplicación destacada de él, no la única
¿Cómo se descarga y ejecuta un llamafile?
Descarga un llamafile precompilado para el modelo que quieras, hazlo ejecutable, y ejecútalo directamente — no hay un paso de instalación separado. También se admite construir un llamafile personalizado a partir de tu propio archivo de modelo GGUF.
- 1Descarga un llamafile precompilado (un modelo empaquetado con el motor) desde la página de Hugging Face del proyecto o la página de GitHub Releases.
- 2En macOS y Linux, marca el archivo como ejecutable (
chmod +x tumodelo.llamafile) si aún no lo es, y luego ejecútalo directamente (./tumodelo.llamafile). - 3En Windows, renombra el archivo para añadir una extensión
.exesi no la tiene ya, debido a cómo Windows identifica los ejecutables. - 4Por defecto, ejecutar el archivo lanza una interfaz web de chat local en tu navegador, junto con un endpoint de servidor compatible con la API de OpenAI.
- 5Para activar la aceleración por GPU, pasa
-ngl 999para descargar tantas capas como sea posible a una GPU detectada (Metal, CUDA, ROCm o Vulkan). - 6Para construir un llamafile personalizado a partir de tu propio modelo GGUF, usa las herramientas de empaquetado del proyecto para combinar el modelo con el binario del motor llamafile.
¿llamafile requiere instalación?
No. Descarga el archivo, hazlo ejecutable si es necesario, y ejecútalo directamente — no hay un instalador separado.
¿Puede llamafile funcionar sin GPU?
Sí. El funcionamiento solo con CPU funciona de forma inmediata; la aceleración por GPU (Metal, CUDA, ROCm, Vulkan) es una mejora de rendimiento opcional, no un requisito.
¿Qué hardware y aceleración por GPU admite llamafile?
llamafile admite el funcionamiento solo con CPU de forma inmediata, con aceleración por GPU opcional en la mayoría de los grandes fabricantes. El soporte de GPU ha evolucionado con el tiempo, así que la capacidad exacta depende de la versión descargada.
- Apple Silicon — aceleración Metal, activada por defecto cuando se detecta una GPU Metal (implementada en diciembre de 2025)
- NVIDIA — aceleración CUDA en Linux, reintroducida en febrero de 2026 tras un período de desincronización con el llama.cpp original
- AMD — aceleración ROCm
- Multiplataforma — soporte del backend Vulkan
- Las bibliotecas de GPU (CUDA, ROCm, Vulkan) se cargan dinámicamente desde archivos precompilados junto al ejecutable en lugar de compilarse de forma permanente dentro de él
¿Para quién es llamafile?
Usa llamafile si distribuir o ejecutar un modelo como un único archivo, sin dependencias, multiplataforma importa más que tener de inmediato las funciones más recientes de llama.cpp; usa llama.cpp directamente o una app envoltorio si esa portabilidad de un solo archivo no es la prioridad.
¿Cómo se compara llamafile con KoboldCpp y otras herramientas sin instalación?
La comparación más cercana a llamafile es KoboldCpp — ambos se distribuyen como un solo archivo construido sobre llama.cpp — pero resuelven problemas distintos: portabilidad multiplataforma frente a una interfaz integrada orientada al rol.
Herramienta | Licencia | Mejor para |
|---|---|---|
| llamafile | Apache 2.0 | Un archivo corre sin cambios en 4 SO |
| KoboldCpp | AGPL 3.0 | Sin instalación, UI de rol/escritura integrada |
| llama.cpp | MIT | Mayor soporte de hardware, control directo |
| Ollama | MIT | CLI/API sencilla, gestión de modelos |
| LM Studio | Propietaria (gratis) | GUI de escritorio sin terminal |
Errores comunes al evaluar llamafile
La mayoría de la confusión viene de no entender cómo funciona el truco multiplataforma de un solo archivo, o de esperar de inmediato las funciones más recientes de llama.cpp.
Preguntas frecuentes
¿Qué es llamafile?
llamafile es un proyecto gratuito con licencia Apache 2.0 que empaqueta un modelo y el motor llama.cpp en un único archivo ejecutable que funciona sin modificación en macOS, Linux, Windows y BSD, usando Cosmopolitan Libc.
¿Quién creó llamafile?
Justine Tunney, creadora de Cosmopolitan Libc, creó llamafile, publicado por primera vez por el grupo de innovación de Mozilla en noviembre de 2023. Ahora se mantiene en github.com/mozilla-ai/llamafile.
¿Cómo puede un archivo correr en macOS, Linux y Windows?
llamafile se construye con Cosmopolitan Libc, una biblioteca estándar de C diseñada para producir un solo binario válido simultáneamente en varios sistemas operativos y arquitecturas de CPU, en lugar de requerir builds separados por plataforma.
¿Es llamafile gratuito para uso comercial?
Sí. llamafile tiene licencia Apache 2.0, gratuita para uso personal y comercial. Sus propios cambios a llama.cpp y whisper.cpp permanecen bajo licencia MIT.
¿Requiere llamafile una GPU?
No. El funcionamiento solo con CPU funciona por defecto; la aceleración por GPU vía Metal, CUDA, ROCm o Vulkan es opcional y mejora la velocidad.
¿Hay un límite de tamaño de archivo para un llamafile?
Sí, específicamente en Windows — Windows limita los archivos ejecutables a 4 GB, lo que puede limitar cuán grande puede ser un modelo empaquetado como un solo llamafile para usuarios de Windows.
¿llamafile se mantiene al día con llama.cpp?
Se sincroniza periódicamente en lugar de continuamente — la versión 0.10.0 introdujo un sistema de compilación reconstruido específicamente para mantener el ritmo de las versiones actuales de llama.cpp, y el soporte de CUDA para Linux se reintrodujo en febrero de 2026 tras un período de retraso.
¿Cuál es la diferencia entre llamafile y KoboldCpp?
Ambos se distribuyen como un solo archivo construido sobre llama.cpp sin instalador separado, pero la característica distintiva de llamafile es la portabilidad genuinamente multiplataforma (un archivo corre en 4 sistemas operativos distintos), mientras que la de KoboldCpp es una interfaz web integrada orientada al rol y la escritura de historias.
¿Puedo crear un llamafile a partir de mi propio modelo?
Sí. El proyecto ofrece herramientas de empaquetado para combinar un archivo de modelo GGUF con el binario del motor llamafile en un ejecutable único personalizado.
¿Es llamafile adecuado para servicio de producción multiusuario?
No es su enfoque. llamafile está construido para una distribución simple y portátil en un solo archivo y uso de un usuario o pequeña escala; para servicio de producción multiusuario de alto rendimiento, vLLM o SGLang son las herramientas más apropiadas.
