Principais conclusões
- Gratuito e sob licença MIT, criado por Ettore Di Giacinto ("mudler") e mantido em github.com/mudler/LocalAI
- API compatível com a OpenAI pronta para substituição direta, além de endpoints compatíveis com Anthropic e ElevenLabs
- Um núcleo leve roteia requisições para backends carregados de forma independente, em vez de embutir um motor de inferência fixo
- Os backends documentados pelo projeto incluem llama.cpp e vLLM para texto, backends baseados em diffusers para geração de imagem e backends baseados em whisper.cpp para transcrição
- Cobre geração de texto, geração de imagem, transcrição, síntese de voz e embeddings a partir de uma única instância em execução
- Roda apenas em CPU sem exigir GPU, ou com aceleração NVIDIA CUDA, AMD ROCm, Intel ou Vulkan
- Distribuído como imagens Docker (variantes de CPU e GPU), um instalador para macOS e um binário de linha de comando; a implantação via Kubernetes é documentada
- Não é um motor de inferência bruta concorrente — carrega motores como llama.cpp e vLLM como backends, em vez de substituí-los
📍 Em uma frase
O LocalAI é um motor gratuito, sob licença MIT e auto-hospedado, que expõe uma API compatível com a OpenAI na frente de backends intercambiáveis — incluindo llama.cpp, vLLM, diffusers e whisper.cpp — cobrindo texto, imagem e áudio a partir de uma única instância.
💬 Em termos simples
Em vez de um app para chat, outro para gerar imagens e outro para transcrever, o LocalAI é um único servidor auto-hospedado que fala a mesma API que a OpenAI usa, então o código cliente já existente pode apontar para ele enquanto, por trás, cada requisição é repassada ao motor que de fato realiza aquela tarefa.
📌Nota: Este artigo se baseia no repositório oficial no GitHub do LocalAI e em sua documentação pública, não em testes próprios. Ele evita afirmações de recursos ligadas a uma versão específica e números de desempenho, já que o LocalAI lança versões com frequência e nenhum dos dois foi medido de forma independente para este artigo.
O que é o LocalAI?
O LocalAI é um motor de IA gratuito, sob licença MIT e auto-hospedado, que permite executar no seu próprio hardware modelos de texto, imagem e áudio compatíveis com a API da OpenAI. Foi criado por Ettore Di Giacinto, conhecido como "mudler" no GitHub, e hoje é mantido por uma comunidade open-source. O projeto descreve seu objetivo como executar modelos em múltiplas modalidades em qualquer hardware, sem exigir estritamente uma GPU.
- Criado por Ettore Di Giacinto ("mudler"); código-fonte e documentação em github.com/mudler/LocalAI
- Sob licença MIT: uso, modificação e auto-hospedagem livres, inclusive para fins comerciais, dentro dos termos da licença
- Expõe um servidor compatível com a API da OpenAI, além de endpoints compatíveis com Anthropic e ElevenLabs documentados, de modo que código cliente já existente para essas APIs muitas vezes pode apontar para uma instância auto-hospedada do LocalAI
- Se posiciona pela amplitude de modalidades, e não por ser o mais rápido em uma única — texto, imagem e áudio a partir de uma só implantação
- Diferente de um único motor de inferência: seu próprio núcleo cuida do roteamento de requisições e da compatibilidade de API, enquanto a execução do modelo acontece em processos de backend separados
Como funciona a arquitetura de backends do LocalAI?
O núcleo do LocalAI é um roteador leve, não um motor de inferência monolítico — ele recebe uma requisição compatível com a OpenAI, determina a qual modelo e backend ela corresponde, e se comunica com um processo de backend separado que de fato executa a inferência.
- O processo principal cuida da compatibilidade de API, do roteamento de requisições e da configuração de modelos, e então se comunica com os processos de backend via gRPC
- Os backends documentados pelo projeto incluem llama.cpp e vLLM para geração de texto, backends baseados em
diffuserspara geração de imagem, e backends baseados emwhisper.cpppara transcrição - Os backends podem ser instalados a partir de uma galeria de modelos/backends, ou configurados manualmente com um arquivo YAML que aponte para um backend e modelo específicos
- Como os backends são componentes instaláveis separados, uma implantação só precisa carregar os backends que seu caso de uso realmente exige, em vez de embutir todos os motores possíveis por padrão
- O projeto também desenvolve alguns backends nativos próprios, além de integrar motores já existentes
O que o LocalAI faz além da geração de texto?
O escopo documentado do LocalAI cobre mais modalidades do que motores somente de texto como o llama.cpp ou o vLLM, o que é sua principal diferença em relação a essas ferramentas.
Geração de texto
- Backend típico:
- llama.cpp, vLLM — endpoints de chat/completions
Geração de imagem
- Backend típico:
- Backends baseados em diffusers (estilo Stable Diffusion)
Transcrição (STT)
- Backend típico:
- Backends baseados em whisper.cpp
Síntese de voz (TTS)
- Backend típico:
- Backends de TTS dedicados documentados pelo projeto
Embeddings
- Backend típico:
- Backends dedicados de modelos de embedding
Cada linha acima é um backend separado que precisa ser instalado para que aquela modalidade funcione — instalar apenas o LocalAI não habilita automaticamente todas as modalidades. Os nomes exatos dos backends e sua cobertura mudam entre versões, então a galeria do próprio projeto é a fonte atual, não uma lista fixa.
De que hardware o LocalAI precisa?
O posicionamento documentado do LocalAI é que ele roda em qualquer hardware, sem exigir estritamente uma GPU — a mesma instância pode rodar apenas em CPU para cargas mais leves, ou usar aceleração por GPU quando disponível para modelos maiores.
Somente CPU
- Detalhes:
- Documentado como totalmente suportado sem exigir GPU, usando backends otimizados para CPU como o llama.cpp para texto.
GPUs NVIDIA (CUDA)
- Detalhes:
- Imagens Docker dedicadas para CUDA são publicadas; a aceleração é usada por backends compatíveis quando há uma GPU suportada.
GPUs AMD (ROCm)
- Detalhes:
- Uma imagem Docker ROCm/hipBLAS é publicada como caminho de aceleração AMD documentado.
GPUs Intel (oneAPI)
- Detalhes:
- Uma imagem Docker dedicada da Intel é publicada para aceleração de GPU Intel.
Vulkan
- Detalhes:
- Uma imagem Docker Vulkan é publicada como opção de aceleração de GPU multifabricante.
Apple Silicon (Mac)
- Detalhes:
- Um instalador nativo para macOS é publicado; backends acelerados por Metal são documentados para Macs com Apple Silicon.
O tamanho de modelo realmente utilizável e a velocidade ainda dependem da RAM/VRAM disponível e do backend usado por um dado modelo, da mesma forma que aconteceria com o llama.cpp ou o vLLM diretamente — o posicionamento "sem GPU necessária" do LocalAI descreve que o caminho somente-CPU é totalmente suportado, não que todo modelo ou backend rode igualmente bem sem uma.
Como instalar e executar o LocalAI?
O caminho mais rápido documentado pelo LocalAI é o Docker, com uma imagem somente de CPU e tags de imagem aceleradas por GPU separadas conforme o hardware.
- 1Instale o Docker se ainda não tiver, depois escolha uma imagem somente de CPU ou uma tag de imagem GPU para o seu hardware.
- 2Para uso somente com CPU, execute:
docker run -p 8080:8080 --name local-ai -ti localai/localai:latest. - 3Para GPUs NVIDIA, use uma imagem CUDA, por exemplo
localai/localai:latest-gpu-nvidia-cuda-12, adicionando--gpus allao comando do Docker. - 4Para GPUs AMD, Intel ou Vulkan, use a tag
-gpu-hipblas,-gpu-intelou-gpu-vulkancorrespondente documentada pelo projeto. - 5Assim que o contêiner estiver em execução, o LocalAI escuta na porta 8080 por padrão.
- 6Instale um modelo pela CLI (
local-ai models install <name>) ou pela galeria de modelos da interface web, ou inicie um diretamente comlocal-ai run <name>, que faz o download primeiro se necessário. - 7Envie sua primeira requisição ao endpoint compatível com a OpenAI: `curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "<nome-do-modelo-instalado>", "messages": [{"role": "user", "content": "Olá!"}]}'`.
- 8Aponte o código cliente já existente da API da OpenAI para sua instância auto-hospedada mudando apenas a URL base e o nome do modelo.
Preciso de GPU para rodar o LocalAI?
Não — o LocalAI é documentado como executável somente em CPU, sem exigir GPU, e publica separadamente tags de imagens Docker aceleradas por GPU para hardware NVIDIA, AMD, Intel e Vulkan para quem tiver uma.
De onde vêm os modelos do LocalAI?
O projeto documenta várias fontes: sua própria galeria de modelos (instalável pela CLI ou pela interface web), repositórios do Hugging Face, referências em formato Ollama, URLs de configuração YAML diretas e imagens OCI.
Como o LocalAI se compara ao Ollama?
O LocalAI e o Ollama facilitam ambos a auto-hospedagem de modelos por trás de uma API simples, mas têm escopos diferentes: o Ollama é construído em torno de um caminho rápido e mínimo, para um único usuário, de modelos de texto (e alguma visão), enquanto o LocalAI aposta em uma cobertura de modalidades mais ampla e compatibilidade de API OpenAI/Anthropic/ElevenLabs para texto, imagem e áudio.
- O Ollama foca principalmente em modelos de texto (e alguma visão), com instalação e download de modelo em um único comando, voltado para configuração rápida de um único usuário
- O LocalAI documenta cobertura de modalidades mais ampla em uma única implantação — texto, geração de imagem, transcrição e síntese de voz — carregando backends diferentes para cada uma
- O LocalAI documenta compatibilidade pronta para substituição com três formatos de API (OpenAI, Anthropic, ElevenLabs); a interface principal do Ollama é sua própria API, com uma camada de compatibilidade OpenAI separada
- O LocalAI pode carregar referências de modelos em formato Ollama (
ollama://) como uma de várias fontes de modelos suportadas, ao lado de sua própria galeria, do Hugging Face e de configurações YAML - A superfície de configuração do Ollama é deliberadamente mínima; o LocalAI expõe mais configuração (seleção de backend, configurações YAML de modelos, múltiplos alvos de implantação) em troca desse escopo mais amplo
Como o LocalAI se compara ao llama.cpp e ao vLLM?
O LocalAI não é um motor de inferência bruta concorrente do llama.cpp ou do vLLM — sua arquitetura documentada carrega ambos como backends intercambiáveis para geração de texto, ao lado de backends separados para imagem e áudio.
llama.cpp
- Papel:
- Um motor de inferência de texto amigável a CPU/GPU; um dos backends de texto que o LocalAI pode carregar.
vLLM
- Papel:
- Um motor de serving em GPU de alto throughput; documentado como outro backend de texto que o LocalAI pode carregar.
LocalAI
- Papel:
- A camada de roteamento e compatibilidade de API acima desses backends, adicionando backends de imagem, áudio e embedding além do texto.
Artigos sobre LocalAI (3)
- Jan Review 2026: The Open-Source, Offline ChatGPT AlternativeAtualizado 6 de setembro de 2026
- LocalAI Explained: The Self-Hosted OpenAI API Alternative (2026)Atualizado 6 de setembro de 2026
- Bodega One Code Review (2026): A Local-First BYOLLM Coding IDEAtualizado 3 de setembro de 2026
Também mencionado em:
- AI Note-Taking Plugins for Obsidian and Logseq, ComparedAtualizado 5 de setembro de 2026
- LibreChat Review 2026: Self-Hosted ChatGPT Alternative for Local LLMsAtualizado 3 de setembro de 2026
- AnythingLLM vs PrivateGPT vs Open WebUI: Best Local RAG in 2026Atualizado 27 de agosto de 2026
Escolher entre esses projetos geralmente não é "ou um ou outro" — uma implantação do LocalAI pode estar rodando llama.cpp ou vLLM por baixo para suas requisições de texto. A decisão é se você quer falar diretamente com esse motor (llama.cpp, vLLM) ou por meio de uma camada de API multimodal mais ampla que também roteia requisições de imagem e áudio (LocalAI).
Quem deve usar o LocalAI?
O LocalAI se encaixa para quem quer uma única superfície de API auto-hospedada cobrindo várias modalidades, não para quem busca apenas o caminho mais rápido até um único modelo de texto na própria máquina.
LocalAI vs. alternativas, em resumo
Essas ferramentas se sobrepõem em alguns pontos, mas diferem em escopo e esforço de configuração.
LocalAI
- Escopo:
- Texto, imagem, áudio, embeddings via backends intercambiáveis. Docker, instalador macOS ou binário CLI.
- Melhor para:
- Uma única API auto-hospedada, multimodal, compatível com OpenAI/Anthropic/ElevenLabs.
Ollama
- Escopo:
- Principalmente modelos de texto (e alguma visão). Instalação e download de modelo em um comando.
- Melhor para:
- O caminho mais rápido até um modelo de texto local para um único usuário.
llama.cpp
- Escopo:
- Motor de inferência de texto para CPU e GPU. CLI, interface web e servidor compatível com OpenAI.
- Melhor para:
- Controle direto em nível de motor sobre a inferência de texto — muitas vezes o backend por trás do Ollama e do LocalAI.
vLLM
- Escopo:
- Biblioteca de serving de texto em GPU de alto throughput. Pacote Python, servidor compatível com OpenAI.
- Melhor para:
- Máximo throughput concorrente de GPU só para texto.
Este artigo não fez benchmark próprio comparando essas ferramentas entre si e não afirma que uma seja tecnicamente superior — a comparação cobre apenas fatos documentados de escopo, configuração e arquitetura.
O que este artigo não cobre?
Este é um artigo explicativo construído a partir da documentação pública e do repositório do LocalAI, não um benchmark prático nem uma auditoria de segurança.
- Sem comparações de throughput, latência ou qualidade de saída medidas de forma independente contra Ollama, llama.cpp ou vLLM — isso depende do backend e modelo configurados no LocalAI, além do hardware
- Sem lista exaustiva de cada backend suportado pelo projeto — o ecossistema de backends muda com o tempo; a galeria e a documentação do próprio projeto são a fonte autorizada para a cobertura atual
- Sem auditoria de segurança linha a linha do código — ele é open-source e sob licença MIT, então o código-fonte está disponível para revisão independente
- Sem cobertura de todo alvo de implantação (manifests do Kubernetes, configurações específicas de nuvem) — este artigo foca nos caminhos de Docker e CLI que a maioria dos self-hosters experimenta primeiro
- Sem verificação independente de recursos multiusuário ou empresariais (chaves de API, cotas, autenticação) além do que o projeto documenta — verifique as capacidades atuais na documentação oficial antes de depender delas para controle de acesso em produção
Erros comuns ao experimentar o LocalAI
A maior parte do atrito com o LocalAI vem de tratá-lo como um único motor fixo, em vez de um roteador na frente de backends separados.
Perguntas frequentes
O que é o LocalAI?
O LocalAI é um motor de IA gratuito, sob licença MIT e auto-hospedado, criado por Ettore Di Giacinto ("mudler"), que expõe uma API compatível com a OpenAI na frente de backends intercambiáveis para modelos de texto, imagem e áudio.
O LocalAI é gratuito?
Sim. O LocalAI é software gratuito e open-source publicado sob licença MIT, sem exigência de assinatura ou conta para auto-hospedá-lo.
O LocalAI precisa de GPU?
Não — o LocalAI é documentado como executável somente em CPU, sem exigir GPU. Imagens Docker aceleradas por GPU separadas também são publicadas para hardware NVIDIA CUDA, AMD ROCm, Intel e Vulkan.
O LocalAI é a mesma coisa que o llama.cpp?
Não. O llama.cpp é um motor de inferência de texto; o LocalAI é uma camada de roteamento e compatibilidade de API que pode carregar o llama.cpp (ou o vLLM, ou outros motores) como um dos vários backends, além de adicionar backends de imagem e áudio.
O LocalAI é melhor que o Ollama?
"Melhor" depende do escopo: o Ollama é uma ferramenta mais simples e estreita, focada principalmente em modelos de texto com configuração mínima, enquanto o LocalAI cobre um conjunto mais amplo de modalidades (texto, imagem, áudio) por trás de uma API, em troca de mais configuração.
Quais APIs o LocalAI suporta?
O LocalAI documenta compatibilidade pronta para substituição com a API da OpenAI, além de endpoints compatíveis com Anthropic e ElevenLabs, de modo que código cliente já existente para essas APIs muitas vezes funciona contra uma instância auto-hospedada do LocalAI apenas mudando a URL base.
O LocalAI consegue gerar imagens e transcrever áudio, não só conversar?
Sim. Os backends documentados do LocalAI incluem backends baseados em diffusers para geração de imagem e backends baseados em whisper.cpp para transcrição, além de backends de síntese de voz e embeddings.
O LocalAI tem alguma relação com o aplicativo móvel "Loci"?
Não. O Loci é um aplicativo móvel separado e sem relação, para chat offline no dispositivo. O LocalAI é o projeto de servidor auto-hospedado em github.com/mudler/LocalAI, sem código, empresa ou relação compartilhada com o Loci.
Qual porta o LocalAI usa por padrão?
O LocalAI escuta na porta 8080 por padrão quando executado por meio de suas imagens Docker documentadas.
De onde o LocalAI pode obter modelos?
O projeto documenta várias fontes de modelos: sua própria galeria instalável, repositórios do Hugging Face, referências em formato Ollama, URLs de configuração YAML diretas e imagens OCI.
