Stacks comuns em produção
Para os leitores que não querem ler as nove categorias, escolha o stack mais próximo e copie-o. Cada linha emparelha um objetivo real com uma combinação testada e o hardware mínimo em que realmente funciona.
Objetivo | Stack | Hardware mínimo |
|---|---|---|
| Chat casual | LM Studio standalone | 16 GB RAM, sem GPU |
| Melhor equilíbrio para usuários avançados | Ollama + Open WebUI | 16 GB RAM, GPU opcional |
| Chat de documentos | Ollama + AnythingLLM | 16 GB RAM, GPU opcional |
| Código | Ollama + Continue.dev | 16 GB RAM + GPU recomendada |
| Roleplay / criativo | KoboldCpp + SillyTavern | 16 GB RAM, GPU recomendada |
| Empresa com privacidade em primeiro lugar | Ollama + Open WebUI + PrivateGPT | 32 GB RAM + 12 GB VRAM |
| Mobile / em movimento | MLC Chat ou PocketPal AI | iPhone 13+ / Pixel 7+ |
| Apple Silicon | Ollama (backend MLX) ou LM Studio | M2/M3/M4/M5 com 16+ GB unificada |
| Equipe multiusuário | vLLM + Open WebUI | 32+ GB RAM + multi-GPU |
Principais conclusões
- Dez camadas, 160+ projetos, um mapa. Runtimes, apps de desktop, interfaces web, integrações IDE, ferramentas de terminal, sistemas RAG, frameworks de agentes, voz/áudio/visão, clientes móveis, plugins de produtividade especializados e geração de imagens — quase todos os projetos populares de 2026 se encaixam exatamente em uma camada.
- Escolha primeiro um runtime. Ollama é a opção padrão adequada para ~95% dos leitores; llama.cpp é o motor fundamental por trás da maioria das outras ferramentas; vLLM é a opção de produção para implantações multiusuário em GPU real.
- A maioria das camadas acima do runtime são opcionais. Um app de desktop OU uma interface web é suficiente para o chat. Adicione uma integração IDE apenas quando quiser assistência de código; ferramentas de terminal apenas quando quiser fluxos de trabalho CLI; um sistema RAG apenas quando quiser conversar com seus próprios documentos; um framework de agentes apenas quando as chamadas de uma única etapa deixarem de ser suficientes; geração de imagens apenas quando precisar de saída visual.
- A licença importa para uso comercial. MIT e Apache 2.0 dominam o ecossistema. AGPL aparece em algumas interfaces (text-generation-webui, KoboldCpp, Jan, SillyTavern) — perfeito para uso pessoal, mais deliberado para implantações comerciais.
- Os stacks de múltiplas ferramentas são a norma. Ollama + Open WebUI + AnythingLLM + Continue.dev + Stable Diffusion é uma configuração de uma única máquina que cobre chat, RAG, código e geração de imagens sem compromisso.
Como este diretório se mantém atualizado
Este diretório é revisado a cada seis meses e corrigido entre as revisões — última atualização em agosto de 2026, próxima revisão programada para novembro de 2026. A expansão de agosto de 2026 adicionou mais de 72 novas ferramentas em todas as camadas, dividiu voz/multimodal em três camadas focadas (STT, TTS, visão), dividiu os assistentes de código em integrações IDE (4a) e ferramentas de terminal (4b), e adicionou uma camada inteiramente nova de geração de imagens. Todos os links e licenças foram reverificados; as novas entradas (PearAI, Windsurf, Sourcegraph Cody, SuperAGI, Leon AI, Draw Things, Fooocus, StableSwarmUI e outras) foram validadas quanto à manutenção ativa. Critérios de inclusão: o projeto está em manutenção ativa (commits nos últimos 90 dias), tem uma licença open-source verificável ou uma declaração clara de uso comercial, e ou tem uma participação de usuários significativa em 2026 ou preenche uma camada que de outra forma estaria vazia. Os projetos que ficam inativos por mais de dois ciclos de versão são removidos; os novos participantes que atendem aos critérios são adicionados na próxima revisão. Para sugerir um projeto para inclusão, abra um issue ou PR contra o repositório do PromptQuorum — inclua a URL do projeto, a licença e uma descrição de uma sentença no formato acima.
Fontes
- ggml-org/llama.cpp GitHub — fonte principal para a arquitetura do runtime e os modelos compatíveis.
- Ollama Library — catálogo oficial de modelos e documentação do runtime.
- LM Studio Documentation — referência de recursos para a GUI de desktop dominante.
- Open WebUI Documentation — referência de recursos para a interface web auto-hospedada dominante.
- Hugging Face Hub — localização principal para baixar os pesos de modelos consumidos por cada runtime listado acima.
- awesome-local-llm GitHub list — inventário mantido pela comunidade usado como verificação da inclusão de projetos.
Perguntas frequentes
Qual é a diferença entre um runtime LLM local e um app de desktop?
Um runtime (Ollama, llama.cpp, vLLM) é o motor que carrega os pesos do modelo e serve uma API — tipicamente compatível com OpenAI. Um app de desktop (LM Studio, Jan, GPT4All) é uma interface de chat que chama um runtime por trás. Algumas apps incluem seu próprio runtime (LM Studio incorpora llama.cpp), outras requerem que você instale um runtime separadamente (Open WebUI chama o Ollama). O runtime decide o que é possível; o app decide o que é conveniente.
Posso usar várias ferramentas desta lista ao mesmo tempo?
Sim — a maioria dos stacks combina 2–4 ferramentas. Uma configuração comum: Ollama como runtime, Open WebUI para chat, AnythingLLM para chat de documentos e Continue.dev para código — as quatro funcionam com a mesma instância do Ollama em uma única máquina. A tabela "Stacks comuns em produção" acima lista as receitas que funcionam sem conflito.
Quais ferramentas funcionam completamente offline sem telemetria?
Ollama, llama.cpp, vLLM, Jan, GPT4All, Open WebUI, AnythingLLM, PrivateGPT, Continue.dev, Aider, KoboldCpp, Llamafile, MLX-LM e a maioria dos apps com licença AGPL/MIT deste diretório funcionam completamente offline uma vez baixado o modelo. LM Studio e várias ferramentas de código fechado têm análises opcionais que podem ser desativadas nas configurações.
Alguma dessas ferramentas tem licença comercial (não gratuita para uso comercial)?
Algumas: LM Studio, Msty, Backyard AI, Layla e Cursor são de código fechado — geralmente gratuitas para usar mas não redistribuíveis, e os termos comerciais variam. Private LLM é pago. As ferramentas com licença AGPL (Jan, KoboldCpp, text-generation-webui, SillyTavern, Khoj, Copilot for Obsidian) são gratuitas para qualquer uso incluindo comercial, mas os termos AGPL exigem divulgar o código-fonte se você as modificar e hospedar publicamente. Os projetos Apache 2.0 e MIT (a maioria) são utilizáveis em qualquer contexto incluindo comercial sem restrições de atribuição além do texto da licença.
Quais ferramentas suportam Apple Silicon (chips da série M) nativamente?
Ollama, llama.cpp, MLX-LM, LM Studio, Jan, Enchanted, GPT4All, MLC Chat, AnythingLLM e a maioria dos apps Electron/Tauri funcionam nativamente no Apple Silicon e usam o backend Metal. MLX-LM é específico da Apple e o mais rápido para modelos grandes em chips M-series. vLLM, TensorRT-LLM e ExLlamaV2 estão focados na NVIDIA e não funcionam ou funcionam mal no Apple Silicon.
Todas essas ferramentas suportam o formato de modelo GGUF?
GGUF é o formato nativo do llama.cpp e qualquer ferramenta que o envolva (Ollama, LM Studio, Jan, GPT4All, KoboldCpp, Llamafile). vLLM e TensorRT-LLM usam seus próprios formatos otimizados (tipicamente AWQ ou FP16) para maior desempenho. ExLlamaV2 usa quantização EXL2. MLX-LM usa pesos convertidos para MLX. A maioria das ferramentas listadas aceita GGUF; algumas (vLLM, TensorRT-LLM, ExLlamaV2, MLX-LM) requerem uma etapa de conversão única a partir dos pesos originais do Hugging Face.
Quais ferramentas são melhores para usuários sem experiência em código?
GPT4All tem a instalação mais simples (um clique, funciona com 8 GB RAM). LM Studio é a mais completa em recursos sem precisar de terminal. Jan é a opção sem código mais focada em privacidade. Para chat de documentos sem trabalho na linha de comando, AnythingLLM é a mais fácil. As quatro estão listadas na categoria de Aplicativos de desktop (GUI) acima.
Posso executar essas ferramentas em um servidor e acessá-las remotamente?
A maioria das ferramentas com capacidade de servidor (Ollama, vLLM, LocalAI, Open WebUI, LibreChat, PrivateGPT, AnythingLLM) expõe uma API HTTP e se vincula a uma interface de rede configurável nas configurações. Padrão padrão: executar o Ollama em um servidor doméstico ou VPS, executar uma interface no seu laptop ou telefone apontando para o IP do servidor. Trate a API como qualquer serviço web — vincular ao localhost por trás de um proxy reverso, ou a uma rede privada com autenticação adequada.
Quais ferramentas suportam configurações multiusuário / de equipe?
Open WebUI, LibreChat, h2oGPT, AnythingLLM (com recursos de administrador habilitados) e Dify são projetados para uso multiusuário, com controle de acesso baseado em funções e histórico de conversas por usuário. vLLM é a camada de serving correta por baixo quando a inferência concorrente importa — ele agrupa solicitações de múltiplos usuários para um desempenho inatingível com Ollama em concorrência acima de ~3.
Com que frequência este diretório é atualizado?
A cada seis meses — última revisão em julho de 2026, a próxima atualização programada é em novembro de 2026. As mudanças intermediárias (um projeto fica inativo, uma nova ferramenta ganha participação significativa, uma licença muda) são aplicadas como patches à entrada existente. Categorias ou camadas completamente novas aguardam uma revisão para manter a estrutura estável.
Posso fazer geração de imagens localmente sem chamadas à nuvem?
Sim — Stable Diffusion, ComfyUI, Invoke AI, AUTOMATIC1111 WebUI e outras ferramentas do Nível 10 rodam inteiramente em hardware local. O Stable Diffusion precisa de 6+ GB de VRAM (RTX 3060, RTX 4060 ou equivalente); o Fooocus e outras interfaces otimizadas podem rodar em placas com 4–6 GB. O Real-ESRGAN amplia imagens geradas; o ControlNet adiciona controle espacial (bordas, poses, mapas de profundidade); o AnimateDiff gera vídeo a partir de texto. Todos funcionam sem enviar dados a servidores externos.