Principais conclusões
- Licença Apache 2.0; as próprias alterações do projeto no llama.cpp e no whisper.cpp permanecem sob MIT para continuar upstreamable
- Cerca de 25.900+ estrelas no GitHub em setembro de 2026, repositório em github.com/mozilla-ai/llamafile
- Criado por Justine Tunney, criadora do Cosmopolitan Libc, lançado pela primeira vez pelo grupo de inovação da Mozilla em novembro de 2023
- Um único arquivo executável roda em macOS, Linux, BSD e Windows — o Windows especificamente limita executáveis a 4 GB
- Aceleração por GPU disponível via Metal (Apple Silicon), CUDA (NVIDIA), ROCm (AMD) e Vulkan
- Construído diretamente sobre o llama.cpp para a inferência do modelo em si, com o Cosmopolitan Libc resolvendo o empacotamento multiplataforma
📍 Em uma frase
O llamafile é um projeto gratuito, licenciado sob Apache 2.0, criado por Justine Tunney e lançado originalmente pela Mozilla, que empacota um modelo e o motor llama.cpp em um único executável que funciona sem modificações em macOS, Linux, Windows e BSD graças ao Cosmopolitan Libc.
💬 Em termos simples
Baixe um arquivo e dê um duplo clique — sem instalador, sem escolher um build específico de plataforma —, porque o próprio arquivo é válido em vários sistemas operacionais ao mesmo tempo, um truque possibilitado pelo Cosmopolitan Libc, e não pelo llamafile empacotando vários builds separados.
📌Nota: A versão 0.10.0 introduziu um sistema de build reconstruído para manter o llamafile alinhado com as versões atuais do llama.cpp, e o suporte a CUDA para Linux foi reintroduzido em fevereiro de 2026, após um período de dessincronização — verifique as notas de versão para conhecer o conjunto exato de recursos da versão baixada.
O que é o llamafile?
O llamafile é um projeto gratuito e de código aberto que empacota um modelo de linguagem junto com o motor de inferência llama.cpp em um único arquivo executável, distribuível e executável sem instalação em vários sistemas operacionais. Foi criado por Justine Tunney e lançado pela primeira vez pelo grupo de inovação da Mozilla em novembro de 2023.
O projeto está hospedado em github.com/mozilla-ai/llamafile (anteriormente sob a organização Mozilla-Ocho) e já ultrapassou cerca de 25.900 estrelas no GitHub. É distribuído sob a licença Apache 2.0, com as próprias alterações do projeto no llama.cpp e no whisper.cpp mantidas sob MIT para permanecerem compatíveis e upstreamable com esses projetos.
- Combina um arquivo de modelo e o motor llama.cpp em um único executável distribuível, em vez de exigir uma instalação de motor separada mais um download de modelo separado
- Baseia-se no llama.cpp para o trabalho de inferência propriamente dito — a própria contribuição do llamafile é a camada de empacotamento e execução multiplataforma
- Por padrão, ao ser executado, abre uma interface de chat web, além de um modo de servidor compatível com a API da OpenAI
- Exemplos pré-compilados de llamafiles para modelos abertos populares são publicados no Hugging Face pelo projeto e por membros da comunidade
O que é o Cosmopolitan Libc, e como ele torna isso possível?
O Cosmopolitan Libc é uma biblioteca padrão C, também criada por Justine Tunney, projetada para compilar binários "gordos" que são simultaneamente executáveis válidos em vários sistemas operacionais e arquiteturas de CPU. Essa é a tecnologia subjacente que torna possível a distribuição multiplataforma em arquivo único do llamafile.
- Um binário construído com o Cosmopolitan Libc pode rodar, sem modificações, em macOS, Linux, BSD e Windows, em vez de exigir um build compilado separadamente para cada sistema operacional
- Isso é diferente de empacotar vários binários específicos de plataforma em um único arquivo — trata-se genuinamente de um único binário válido em vários sistemas
- O Windows impõe um limite de tamanho de arquivo de 4 GB aos executáveis, o que limita o quão grande um único llamafile pode ser especificamente nessa plataforma
- O Cosmopolitan Libc é um projeto separado e de uso geral; o llamafile é uma aplicação proeminente dele, não a única
Como você baixa e executa um llamafile?
Baixe um llamafile pré-compilado para o modelo desejado, torne-o executável e execute-o diretamente — não há uma etapa de instalação separada. Também é possível criar um llamafile personalizado a partir do seu próprio arquivo de modelo GGUF.
- 1Baixe um llamafile pré-compilado (um modelo empacotado com o motor) na página do Hugging Face do projeto ou na página de releases do GitHub.
- 2No macOS e no Linux, torne o arquivo executável (
chmod +x seumodelo.llamafile) caso ainda não esteja, e execute-o diretamente (./seumodelo.llamafile). - 3No Windows, renomeie o arquivo adicionando a extensão
.execaso ele ainda não a tenha, devido à forma como o Windows identifica executáveis. - 4Por padrão, executar o arquivo abre uma interface de chat web local no seu navegador, além de um endpoint de servidor compatível com a API da OpenAI.
- 5Para ativar a aceleração por GPU, passe
-ngl 999para transferir o máximo possível de camadas para uma GPU detectada (Metal, CUDA, ROCm ou Vulkan). - 6Para criar um llamafile personalizado a partir do seu próprio modelo GGUF, use as ferramentas de empacotamento do projeto para combinar o modelo com o binário do motor llamafile.
O llamafile exige instalação?
Não. Baixe o arquivo, torne-o executável se necessário, e execute-o diretamente — não há instalador separado.
O llamafile pode rodar sem GPU?
Sim. A operação apenas com CPU funciona de imediato; a aceleração por GPU (Metal, CUDA, ROCm, Vulkan) é uma melhoria opcional de desempenho, não um requisito.
Que hardware e aceleração por GPU o llamafile suporta?
O llamafile suporta operação apenas com CPU de imediato, com aceleração por GPU opcional na maioria dos principais fabricantes. O suporte a GPU evoluiu com o tempo, então a capacidade exata depende da versão baixada.
- Apple Silicon — aceleração Metal, ativada por padrão quando uma GPU Metal é detectada (implementada em dezembro de 2025)
- NVIDIA — aceleração CUDA no Linux, reintroduzida em fevereiro de 2026 após um período de dessincronização com o llama.cpp original
- AMD — aceleração ROCm
- Multiplataforma — suporte ao backend Vulkan
- As bibliotecas de GPU (CUDA, ROCm, Vulkan) são carregadas dinamicamente a partir de arquivos pré-compilados ao lado do executável, em vez de serem compiladas permanentemente nele
Quem deveria usar o llamafile?
Use o llamafile se distribuir ou executar um modelo como um único arquivo, sem dependências e multiplataforma for mais importante do que ter os recursos mais recentes do llama.cpp imediatamente; use o llama.cpp diretamente ou um aplicativo wrapper se essa portabilidade em arquivo único não for a prioridade.
Como o llamafile se compara ao KoboldCpp e a outras ferramentas sem instalação?
A comparação mais próxima do llamafile é o KoboldCpp — ambos são distribuídos como um único arquivo construído sobre o llama.cpp —, mas resolvem problemas diferentes: portabilidade multiplataforma versus uma interface integrada voltada para roleplay.
Ferramenta | Licença | Melhor para |
|---|---|---|
| llamafile | Apache 2.0 | Um arquivo roda sem alterações em 4 SOs |
| KoboldCpp | AGPL 3.0 | Sem instalação, UI de roleplay/história incluída |
| llama.cpp | MIT | Maior suporte a hardware, controle direto |
| Ollama | MIT | CLI/API fácil, gerenciamento de modelos |
| LM Studio | Proprietária (gratuita) | GUI de desktop sem terminal |
Erros comuns ao avaliar o llamafile
A maior parte da confusão vem de mal-entendidos sobre como funciona o truque multiplataforma de arquivo único, ou da expectativa de ter os recursos mais recentes do llama.cpp imediatamente.
Perguntas frequentes
O que é o llamafile?
O llamafile é um projeto gratuito, licenciado sob Apache 2.0, que empacota um modelo e o motor llama.cpp em um único arquivo executável que roda sem modificações em macOS, Linux, Windows e BSD, usando o Cosmopolitan Libc.
Quem criou o llamafile?
Justine Tunney, criadora do Cosmopolitan Libc, criou o llamafile, lançado pela primeira vez pelo grupo de inovação da Mozilla em novembro de 2023. Atualmente é mantido em github.com/mozilla-ai/llamafile.
Como um arquivo pode rodar em macOS, Linux e Windows?
O llamafile é construído com o Cosmopolitan Libc, uma biblioteca padrão C projetada para produzir um único binário que é válido simultaneamente em vários sistemas operacionais e arquiteturas de CPU, em vez de exigir builds separados por plataforma.
O llamafile é gratuito para uso comercial?
Sim. O llamafile é licenciado sob Apache 2.0, gratuito para uso pessoal e comercial. Suas próprias alterações no llama.cpp e no whisper.cpp permanecem licenciadas sob MIT.
O llamafile precisa de GPU?
Não. A operação apenas com CPU funciona por padrão; a aceleração por GPU via Metal, CUDA, ROCm ou Vulkan é opcional e melhora a velocidade.
Há um limite de tamanho de arquivo para um llamafile?
Sim, especificamente no Windows — o Windows limita executáveis a 4 GB, o que pode limitar o quão grande um modelo pode ser empacotado como um único llamafile para usuários do Windows.
O llamafile se mantém atualizado com o llama.cpp?
Ele sincroniza periodicamente, não continuamente — a versão 0.10.0 introduziu um sistema de build reconstruído especificamente para acompanhar as versões atuais do llama.cpp, e o suporte a CUDA para Linux foi reintroduzido em fevereiro de 2026, após um período de atraso.
Qual é a diferença entre o llamafile e o KoboldCpp?
Ambos são distribuídos como um único arquivo construído sobre o llama.cpp, sem instalador separado, mas o diferencial do llamafile é a portabilidade genuinamente multiplataforma (um arquivo roda em 4 sistemas operacionais diferentes), enquanto o diferencial do KoboldCpp é uma interface web integrada voltada para roleplay e escrita de histórias.
Posso criar um llamafile a partir do meu próprio modelo?
Sim. O projeto fornece ferramentas de empacotamento para combinar um arquivo de modelo GGUF com o binário do motor llamafile em um executável único personalizado.
O llamafile é bom para atender múltiplos usuários em produção?
Não é o foco dele. O llamafile é feito para distribuição simples e portátil em arquivo único, e para uso por um único usuário ou em pequena escala; para atendimento de produção multiusuário de alto throughput, o vLLM ou o SGLang são as ferramentas mais adequadas.
