Skip to main content
PromptQuorum
Início/LLMs locais avançados/O diretório completo de software LLM local: 160+ ferramentas para executar IA no seu próprio hardware (2026)
Overview & Reference

O diretório completo de software LLM local: 160+ ferramentas para executar IA no seu próprio hardware (2026)

·28 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

Este diretório atualizado de 2026 (última atualização em julho de 2026) mapeia 88 ferramentas LLM local, ferramentas de implantação e frameworks em nove camadas. O ecossistema de LLM local em 2026 se divide claramente nessas camadas. Os runtimes (Ollama, llama.cpp, vLLM) processam tokens pelo modelo; os apps de desktop (LM Studio, Jan, GPT4All) envolvem um runtime em uma interface de chat; as interfaces web (Open WebUI, LibreChat) fazem o mesmo no navegador; os assistentes de código (Continue.dev, Cline, Aider) conectam um modelo local ao seu editor; os sistemas RAG (AnythingLLM, PrivateGPT) o apontam para seus documentos; os frameworks de agentes (LangChain, CrewAI, LangGraph) encadeiam chamadas em fluxos de trabalho de múltiplas etapas; os stacks de voz e multimodal (Whisper.cpp, Piper, LLaVA) o estendem além do texto; os clientes móveis (MLC Chat, PocketPal AI) o levam ao telefone; e os plugins de produtividade especializados (Obsidian, Logseq, AutoGPT) o integram às ferramentas que você já usa.**

Este é um diretório atualizado de 2026 com 160+ ferramentas, aplicativos, frameworks e software de implantação de LLM local — última atualização em agosto de 2026. O ecossistema de LLM local em 2026 se estende por dez camadas distintas, e fazer as escolhas certas em cada camada é essencial para construir um stack que resolva seu problema sem sobrecarga. Este diretório cataloga 160+ projetos em manutenção ativa em dez camadas — runtimes, aplicativos de desktop, interfaces web, integrações IDE, ferramentas de terminal, sistemas RAG, frameworks de agentes, voz/áudio, clientes móveis, plugins de produtividade especializados e geração de imagens — com descrição, licença e URL principal para cada um. Seja escolhendo ferramentas LLM local, ferramentas de implantação para atendimento multiusuário, frameworks para construir agentes ou sistemas visuais de IA, use-o como o mapa de "o que existe" antes de se comprometer com um stack; cada categoria termina com um link para o guia de comparação mais detalhado do PromptQuorum para essa camada.

Esta página contém links de referência para produtos de terceiros. O PromptQuorum não está inscrito em nenhum programa de afiliados — são links simples que não geram comissão. Clicar nos links e os próximos passos são de sua inteira responsabilidade. Estes links não representam qualquer endosso ou verificação por parte do PromptQuorum.

Apresentação: O diretório completo de software LLM local: 160+ ferramentas para executar IA no seu próprio hardware (2026)

A apresentação cobre: uma visão geral do stack LLM local em 9 camadas (de runtimes a plugins especializados); tabelas de comparação de 6 ferramentas para runtimes (Ollama/llama.cpp/vLLM/LocalAI/ExLlamaV2/MLX-LM), apps de desktop, interfaces web, assistentes de código, sistemas RAG e frameworks de agentes; uma tabela de stacks do mundo real de 9 linhas (objetivo, stack, hardware mínimo); um guia de seleção de stack em 5 passos; e FAQ. Baixe o PDF como cartão de referência do diretório de software LLM local.

Navegue pelos slides abaixo ou baixe em PDF para referência offline. Baixar cartão de referência (PDF)

Principais conclusões

  • Nove camadas, 88 projetos, um mapa. Runtimes, apps de desktop, interfaces web, assistentes de código, sistemas RAG, frameworks de agentes, voz/multimodal, clientes móveis e plugins de produtividade especializados — quase todos os projetos populares de 2026 se encaixam exatamente em uma camada.
  • Escolha primeiro um runtime. Ollama é a opção padrão adequada para ~95% dos leitores; llama.cpp é o motor fundamental por trás da maioria das outras ferramentas; vLLM é a opção de produção para implantações multiusuário em GPU real.
  • A maioria das camadas acima do runtime são opcionais. Um app de desktop OU uma interface web é suficiente para o chat. Adicione um assistente de código apenas quando quiser integração IDE; adicione um sistema RAG apenas quando quiser conversar com seus próprios documentos; adicione um framework de agentes apenas quando as chamadas de uma única etapa deixarem de ser suficientes.
  • A licença importa para uso comercial. MIT e Apache 2.0 dominam o ecossistema. AGPL aparece em algumas interfaces (text-generation-webui, KoboldCpp, Jan, SillyTavern) — perfeito para uso pessoal, mais deliberado para implantações comerciais.
  • Os stacks de múltiplas ferramentas são a norma. Ollama + Open WebUI + AnythingLLM + Continue.dev é uma configuração de uma única máquina que cobre chat, RAG e código sem compromisso.
As 9 camadas de um stack LLM local: 88 projetos em manutenção ativa abrangendo runtimes (Ollama, llama.cpp, vLLM), apps de desktop (LM Studio, Jan, GPT4All), interfaces web, assistentes de código, sistemas RAG, frameworks de agentes, voz e multimodal, clientes móveis e ferramentas de produtividade especializadas.
As 9 camadas de um stack LLM local: 88 projetos em manutenção ativa abrangendo runtimes (Ollama, llama.cpp, vLLM), apps de desktop (LM Studio, Jan, GPT4All), interfaces web, assistentes de código, sistemas RAG, frameworks de agentes, voz e multimodal, clientes móveis e ferramentas de produtividade especializadas.

1. Runtimes e motores de inferência LLM local

Um runtime é o motor que carrega os pesos do modelo na memória e converte prompts em tokens. É a primeira decisão em um stack LLM local e a que condiciona tudo que está acima — cada app de desktop, interface web e assistente de código chama em última instância um runtime. O Ollama domina a participação de mercado orientada ao usuário em 2026 porque inclui uma API compatível com OpenAI e uma instalação de um único comando; o llama.cpp é o motor C++ que sustenta a maioria das outras ferramentas; o vLLM é a opção adequada quando você precisa atender usuários concorrentes em uma GPU real.

Ollama

Descrição:
O mais fácil em geral — instalação de um comando, API compatível com OpenAI, enorme biblioteca de modelos
Licença:
MIT

llama.cpp

Descrição:
Motor C++ fundamental por trás da maioria das outras ferramentas, funciona em qualquer lugar incluindo Apple Silicon
Licença:
MIT

vLLM

Descrição:
Serving de alto desempenho para implantações GPU multiusuário
Licença:
Apache 2.0

LocalAI

Descrição:
Substituto drop-in da API OpenAI que suporta múltiplos backends
Licença:
MIT

TensorRT-LLM

Descrição:
Inferência otimizada pela NVIDIA para configurações GPU enterprise
Licença:
Apache 2.0

MLC LLM

Descrição:
Runtime de implantação para dispositivos móveis e edge
Licença:
Apache 2.0

SGLang

Descrição:
Serving de inferência estruturada para pipelines de agentes
Licença:
Apache 2.0

ExLlamaV2

Descrição:
Inferência quantizada rápida otimizada para GPUs RTX
Licença:
MIT

KoboldCpp

Descrição:
Wrapper leve de llama.cpp com interface integrada
Licença:
AGPL 3.0

Llamafile

Descrição:
Execução LLM portátil em um único arquivo pela Mozilla
Licença:
Apache 2.0

MLX-LM

Descrição:
Runtime nativo do Apple Silicon pela Apple Research
Licença:
MIT

Guia mais detalhado: llama.cpp vs Ollama vs vLLM

Ollama vs llama.cpp vs vLLM: Ollama é MIT com instalação de um comando e API compatível com OpenAI; llama.cpp é o motor C++ fundamental com licença MIT; vLLM é a opção Apache 2.0 de serving multiusuário para implantações GPU.
Ollama vs llama.cpp vs vLLM: Ollama é MIT com instalação de um comando e API compatível com OpenAI; llama.cpp é o motor C++ fundamental com licença MIT; vLLM é a opção Apache 2.0 de serving multiusuário para implantações GPU.
Ver preços do RunPod e registrar-selink de produto · divulgadoVer preços do Vast.ai e registrar-selink de produto · divulgadoVer preços do Lambda Labs e registrar-selink de produto · divulgado

2. Aplicativos de desktop (GUI)

Os apps de desktop envolvem um runtime em uma interface de chat e um explorador de modelos. São onde a maioria dos usuários não técnicos começa porque não há etapa de terminal — baixar, clicar, conversar. LM Studio, Jan e GPT4All têm a maior parte da base de usuários em 2026.

LM Studio

Descrição:
A GUI mais polida, explorador de modelos do HuggingFace integrado, modo servidor
Licença:
Grátis (fechado)

Atomic Chat

Descrição:
App de chat offline para desktop e celular com agentes locais em um clique
Licença:
Apache 2.0

Jan

Link:
jan.ai
Descrição:
Clone offline do ChatGPT com foco em privacidade, totalmente open-source
Licença:
AGPL 3.0

GPT4All

Descrição:
Adequado para iniciantes com forte suporte de apenas CPU
Licença:
MIT

AnythingLLM

Descrição:
RAG e chat de documentos com armazenamento vetorial integrado
Licença:
MIT

Msty

Descrição:
UX de consumidor limpa, suporte multi-provedor
Licença:
Grátis (fechado)

Cherry Studio

Descrição:
IA de desktop multi-provedor com personalização extensiva
Licença:
AGPL 3.0

Backyard AI

Descrição:
Cliente de desktop para chat de personagens e roleplay
Licença:
Grátis (fechado)

Enchanted

Descrição:
Cliente Ollama mínimo nativo de macOS/iOS
Licença:
Apache 2.0

h2oGPT

Descrição:
Desktop e servidor com muitos recursos enterprise
Licença:
Apache 2.0

Open Interpreter

Descrição:
Permite que um LLM local controle seu computador e execute código
Licença:
AGPL 3.0

Locally Uncensored

Descrição:
Chat / Código / Imagens / LoRA / Térmico-otimizado
Licença:
AGPL-3.0

Guia mais detalhado: LM Studio vs Jan vs GPT4All

Ver preços do Mstylink de produto · divulgadoVer preços do AnythingLLM Cloudlink de produto · divulgado

3. Interfaces web e frontends de navegador

As interfaces web são clones do ChatGPT auto-hospedados — a mesma superfície conversacional, mas apontando para um runtime que roda na sua própria máquina ou LAN. O Open WebUI domina o segmento de self-hosting em 2026, com LibreChat como alternativa de recursos de equipe e SillyTavern como a interface dedicada ao roleplay.

Open WebUI

Descrição:
A interface auto-hospedada estilo ChatGPT mais popular, com RAG integrado
Licença:
BSD 3-Clause

LibreChat

Descrição:
Alternativa ao ChatGPT multi-modelo com recursos de equipe
Licença:
MIT

text-generation-webui

Descrição:
Interface para usuários avançados com extenso ecossistema de plugins
Licença:
AGPL 3.0

SillyTavern

Descrição:
Roleplay e chat de personagens com lorebooks
Licença:
AGPL 3.0

LobeChat

Descrição:
Interface moderna e polida com marketplace de plugins
Licença:
MIT

Big-AGI

Descrição:
Frontend multi-provedor avançado com personas
Licença:
MIT

NextChat

Descrição:
Chat web leve, implantação simples
Licença:
MIT

Page Assist

Descrição:
IA na barra lateral do navegador para Chrome e Firefox
Licença:
MIT

Chatbox

Descrição:
Cliente multiplataforma de desktop e web
Licença:
GPLv3

Guia mais detalhado: SillyTavern vs Agnai vs RisuAI

4. Assistentes de código e integrações IDE

Os assistentes de código conectam um LLM local ao seu editor ou terminal via APIs compatíveis com OpenAI. A escolha depende principalmente do fluxo de trabalho: autocompletar no editor (Continue.dev), edições de agente autônomo (Cline, OpenHands) ou edições diff nativas de git no terminal (Aider).

Continue.dev

Descrição:
Autocompletar e chat no VS Code e JetBrains com modelos locais
Licença:
Apache 2.0

Aider

Descrição:
Pair programmer em terminal com suporte de edição multi-arquivo
Licença:
Apache 2.0

Cline

Descrição:
Agente de código autônomo para VS Code
Licença:
Apache 2.0

Tabby

Descrição:
Alternativa auto-hospedada ao GitHub Copilot
Licença:
Apache 2.0

CodeGPT

Descrição:
Integrações IDE para múltiplos editores
Licença:
MIT

OpenHands

Descrição:
Agente desenvolvedor de software IA (anteriormente OpenDevin)
Licença:
MIT

Cursor (modo local)

Descrição:
Editor de código focado em IA com suporte para modelos locais
Licença:
Grátis (fechado)

Twinny

Descrição:
Alternativa gratuita ao Copilot para VS Code
Licença:
MIT

Guia mais detalhado: Continue.dev vs Cline vs Aider

3 padrões de código com LLM local: Continue.dev para autocompletar inline no VS Code e JetBrains, Cline para edições autônomas de agente, e Aider para diffs em terminal nativos de git — todos se conectam ao Ollama via API compatível com OpenAI.
3 padrões de código com LLM local: Continue.dev para autocompletar inline no VS Code e JetBrains, Cline para edições autônomas de agente, e Aider para diffs em terminal nativos de git — todos se conectam ao Ollama via API compatível com OpenAI.
Ver preços do Cursorlink de produto · divulgado

5. Sistemas RAG e chat de documentos

Os sistemas RAG (Retrieval-Augmented Generation) combinam um LLM local com um modelo de embeddings e um armazenamento vetorial para que o modelo possa responder a partir dos seus próprios documentos. A divisão é entre apps plug-and-play (AnythingLLM, PrivateGPT, Quivr, Khoj) que "simplesmente funcionam" e bibliotecas de framework (LlamaIndex, Haystack, txtai) sobre as quais você pode construir.

AnythingLLM

Descrição:
RAG pessoal tudo-em-um mais fácil, com espaços de trabalho
Licença:
MIT

PrivateGPT

Descrição:
RAG completamente offline orientado a empresas
Licença:
Apache 2.0

Quivr

Descrição:
Assistente de conhecimento pessoal auto-hospedado
Licença:
Apache 2.0

Khoj

Descrição:
Segundo cérebro IA pessoal, sincronizado com Obsidian e Notion
Licença:
AGPL 3.0

Dify

Link:
dify.ai
Descrição:
Construtor de fluxos de trabalho IA com suporte RAG e agentes
Licença:
Modified Apache 2.0

Flowise

Descrição:
Construtor visual de fluxos de trabalho LangChain
Licença:
Apache 2.0

Langflow

Descrição:
Orquestração visual de IA com componentes RAG
Licença:
MIT

LlamaIndex

Descrição:
Framework RAG / biblioteca Python — base para desenvolvimentos personalizados
Licença:
MIT

Haystack

Descrição:
Framework de busca e RAG pela deepset
Licença:
Apache 2.0

RAGFlow

Descrição:
Compreensão profunda de documentos para RAG com extração de citações
Licença:
Apache 2.0

txtai

Descrição:
Banco de dados vetorial + LLM integrado em uma única biblioteca
Licença:
Apache 2.0

Guia mais detalhado: AnythingLLM vs PrivateGPT vs Open WebUI

Divisão do RAG local: apps plug-and-play (AnythingLLM, PrivateGPT, Quivr, RAGFlow, Khoj) para chat de documentos sem código vs bibliotecas de framework (LlamaIndex, Haystack, Dify, Flowise, txtai) para construir pipelines personalizados.
Divisão do RAG local: apps plug-and-play (AnythingLLM, PrivateGPT, Quivr, RAGFlow, Khoj) para chat de documentos sem código vs bibliotecas de framework (LlamaIndex, Haystack, Dify, Flowise, txtai) para construir pipelines personalizados.

6. Frameworks de agentes e orquestração

Os frameworks de agentes convertem as chamadas de uma única etapa a um LLM em fluxos de trabalho de múltiplas etapas — planejar, agir, observar, repetir. O LangChain continua sendo o padrão de propósito geral; CrewAI e AutoGen se especializam em configurações multiagente baseadas em funções; LangGraph é a opção correta quando o gerenciamento de estado importa ao longo de fluxos de longa duração.

LangChain

Descrição:
Framework de aplicações LLM de propósito geral
Licença:
MIT

LlamaIndex

Descrição:
Framework de agentes e dados focado em RAG
Licença:
MIT

CrewAI

Descrição:
Fluxos de trabalho multiagente baseados em funções
Licença:
MIT

AutoGen

Descrição:
Framework de orquestração multiagente da Microsoft
Licença:
CC-BY-4.0 / MIT

Semantic Kernel

Descrição:
SDK de orquestração enterprise da Microsoft em C#/Python/Java
Licença:
MIT

LangGraph

Descrição:
Fluxos de trabalho de agentes baseados em grafos com estado
Licença:
MIT

Letta (anteriormente MemGPT)

Descrição:
Agentes com memória de longo prazo
Licença:
Apache 2.0

Pydantic AI

Descrição:
Framework de agentes com tipos seguros construído sobre Pydantic
Licença:
MIT

Guia mais detalhado: Agentes IA locais com MCP

7. Voz, fala e multimodal

Os stacks de voz e multimodal estendem um LLM local além do texto — fala de entrada (STT), fala de saída (TTS) e visão. Whisper.cpp e faster-whisper são os proprietários da camada STT local; Piper e Coqui compartilham a camada TTS com XTTS v2 dominando a clonagem de voz; LLaVA e os modelos de visão do Ollama cobrem o lado visual.

Whisper.cpp

Descrição:
Reconhecimento de voz local, funciona em CPU ou GPU
Licença:
MIT

faster-whisper

Descrição:
Transcrição rápida do Whisper via CTranslate2
Licença:
MIT

Piper TTS

Descrição:
Síntese de texto para voz local leve
Licença:
MIT

Coqui TTS

Descrição:
Síntese de voz open-source com múltiplas opções de modelos
Licença:
MPL 2.0

XTTS v2

Descrição:
Clonagem de voz com suporte multilíngue
Licença:
CPML

Bark

Descrição:
Voz generativa com sons que não são fala
Licença:
MIT

StyleTTS 2

Descrição:
TTS de alta qualidade e som natural
Licença:
MIT

LLaVA

Descrição:
Modelo local de visão + linguagem
Licença:
Apache 2.0

Modelos de visão do Ollama

Descrição:
Visão local via Ollama (Llama 3.2 Vision, Llava, etc.)
Licença:
Vários

Guia mais detalhado: Construa um assistente de voz local no seu telefone

8. Clientes móveis e edge

Os clientes móveis executam um modelo quantizado diretamente no telefone usando Apple Neural Engine, Qualcomm NPU ou inferência pura de CPU. O projeto MLC LLM é a camada fundamental; os apps de consumo (PocketPal AI, Private LLM, LLM Farm, Layla) o envolvem com uma interface de chat. Telefones de alta gama em 2026 executam modelos 2–4B em velocidades úteis (8–15 tokens/s); 7B está no limite do factível para o hardware de mais alto nível.

MLC Chat

Descrição:
Runtime LLM móvel multiplataforma
Licença:
Apache 2.0

PocketPal AI

Descrição:
Cliente LLM local gratuito para iOS e Android
Licença:
MIT

Private LLM

Descrição:
App LLM local polida para iOS e macOS
Licença:
Pago (fechado)

LLM Farm

Descrição:
LLM local para iOS com explorador de modelos
Licença:
MIT

Layla

Descrição:
App LLM local orientada a Android
Licença:
Grátis (fechado)

Maid

Descrição:
App Flutter móvel open-source para LLM
Licença:
MIT

Enchanted

Descrição:
Cliente Ollama nativo de iOS/macOS
Licença:
Apache 2.0

Chapper

Descrição:
Cliente móvel nativo para Ollama e LM Studio
Licença:
Grátis

RikkaHub

Descrição:
IA local Android de código aberto
Licença:
MIT

AnythingLLM Mobile

Descrição:
Acesso remoto ao seu espaço de trabalho local do AnythingLLM
Licença:
MIT

Guia mais detalhado: Os melhores apps LLM local para iPhone em 2026

9. Ferramentas especializadas e de produtividade

As ferramentas especializadas integram LLMs locais em apps que você já usa — plataformas de anotação (Obsidian, Logseq, Joplin), agentes de tarefas autônomos (AutoGPT, BabyAGI, MetaGPT) e frontends de roleplay (Agnai, RisuAI).

Smart Connections

Descrição:
Plugin de busca semântica e chat para Obsidian
Licença:
GPL 3.0

Copilot for Obsidian

Descrição:
Plugin de chat LLM local para Obsidian
Licença:
AGPL 3.0

Text Generator

Descrição:
Plugin de geração de conteúdo para Obsidian
Licença:
MIT

logseq-copilot

Descrição:
Plugin do Logseq para chat LLM local e na nuvem
Licença:
AGPL 3.0

BMO Chatbot

Descrição:
Chatbot do Obsidian com LLM local
Licença:
MIT

Joplin AI

Descrição:
Anotações do Joplin com integrações de IA local
Licença:
MIT

AutoGPT (local)

Descrição:
Agente de tarefas autônomo com suporte para Ollama
Licença:
MIT

BabyAGI

Descrição:
Agente autônomo leve
Licença:
MIT

MetaGPT

Descrição:
Simulação de empresa de software com múltiplos agentes
Licença:
MIT

Agnai

Descrição:
Frontend de roleplay com cartões de personagens
Licença:
MIT

RisuAI

Descrição:
Frontend de roleplay adaptado para mobile
Licença:
GPL 3.0

Guia mais detalhado: LLM local com Obsidian em 2026

Stacks comuns em produção

Para os leitores que não querem ler as nove categorias, escolha o stack mais próximo e copie-o. Cada linha emparelha um objetivo real com uma combinação testada e o hardware mínimo em que realmente funciona.

ObjetivoStackHardware mínimo
Chat casualLM Studio standalone16 GB RAM, sem GPU
Melhor equilíbrio para usuários avançadosOllama + Open WebUI16 GB RAM, GPU opcional
Chat de documentosOllama + AnythingLLM16 GB RAM, GPU opcional
CódigoOllama + Continue.dev16 GB RAM + GPU recomendada
Roleplay / criativoKoboldCpp + SillyTavern16 GB RAM, GPU recomendada
Empresa com privacidade em primeiro lugarOllama + Open WebUI + PrivateGPT32 GB RAM + 12 GB VRAM
Mobile / em movimentoMLC Chat ou PocketPal AIiPhone 13+ / Pixel 7+
Apple SiliconOllama (backend MLX) ou LM StudioM2/M3/M4/M5 com 16+ GB unificada
Equipe multiusuáriovLLM + Open WebUI32+ GB RAM + multi-GPU
9 stacks LLM locais comuns por objetivo: desde LM Studio standalone (16 GB RAM, sem GPU) até vLLM + Open WebUI para equipes multiusuário (32 GB RAM + multi-GPU), com Ollama + Open WebUI como o melhor equilíbrio por padrão com 16 GB RAM.
9 stacks LLM locais comuns por objetivo: desde LM Studio standalone (16 GB RAM, sem GPU) até vLLM + Open WebUI para equipes multiusuário (32 GB RAM + multi-GPU), com Ollama + Open WebUI como o melhor equilíbrio por padrão com 16 GB RAM.

Como este diretório se mantém atualizado

Este diretório é revisado a cada seis meses e corrigido entre as revisões — última atualização em julho de 2026, próxima revisão em novembro de 2026. A revisão mais recente reverificou todos os links e corrigiu vários nomes de projetos e licenças: Faraday agora é Backyard AI, o fork mantido do Coqui TTS é hospedado pela Idiap e o Cherry Studio é AGPL 3.0. Critérios de inclusão: o projeto está em manutenção ativa (commits nos últimos 90 dias), tem uma licença open-source verificável ou uma declaração clara de uso comercial, e ou tem uma participação de usuários significativa em 2026 ou preenche uma camada que de outra forma estaria vazia. Os projetos que ficam inativos por mais de dois ciclos de versão são removidos; os novos participantes que atendem aos critérios são adicionados na próxima revisão. Para sugerir um projeto para inclusão, abra um issue ou PR contra o repositório do PromptQuorum — inclua a URL do projeto, a licença e uma descrição de uma sentença no formato acima.

Fontes

Perguntas frequentes

Qual é a diferença entre um runtime LLM local e um app de desktop?

Um runtime (Ollama, llama.cpp, vLLM) é o motor que carrega os pesos do modelo e serve uma API — tipicamente compatível com OpenAI. Um app de desktop (LM Studio, Jan, GPT4All) é uma interface de chat que chama um runtime por trás. Algumas apps incluem seu próprio runtime (LM Studio incorpora llama.cpp), outras requerem que você instale um runtime separadamente (Open WebUI chama o Ollama). O runtime decide o que é possível; o app decide o que é conveniente.

Posso usar várias ferramentas desta lista ao mesmo tempo?

Sim — a maioria dos stacks combina 2–4 ferramentas. Uma configuração comum: Ollama como runtime, Open WebUI para chat, AnythingLLM para chat de documentos e Continue.dev para código — as quatro funcionam com a mesma instância do Ollama em uma única máquina. A tabela "Stacks comuns em produção" acima lista as receitas que funcionam sem conflito.

Quais ferramentas funcionam completamente offline sem telemetria?

Ollama, llama.cpp, vLLM, Jan, GPT4All, Open WebUI, AnythingLLM, PrivateGPT, Continue.dev, Aider, KoboldCpp, Llamafile, MLX-LM e a maioria dos apps com licença AGPL/MIT deste diretório funcionam completamente offline uma vez baixado o modelo. LM Studio e várias ferramentas de código fechado têm análises opcionais que podem ser desativadas nas configurações.

Alguma dessas ferramentas tem licença comercial (não gratuita para uso comercial)?

Algumas: LM Studio, Msty, Backyard AI, Layla e Cursor são de código fechado — geralmente gratuitas para usar mas não redistribuíveis, e os termos comerciais variam. Private LLM é pago. As ferramentas com licença AGPL (Jan, KoboldCpp, text-generation-webui, SillyTavern, Khoj, Open Interpreter, Copilot for Obsidian) são gratuitas para qualquer uso incluindo comercial, mas os termos AGPL exigem divulgar o código-fonte se você as modificar e hospedar publicamente. Os projetos Apache 2.0 e MIT (a maioria) são utilizáveis em qualquer contexto incluindo comercial sem restrições de atribuição além do texto da licença.

Quais ferramentas suportam Apple Silicon (chips da série M) nativamente?

Ollama, llama.cpp, MLX-LM, LM Studio, Jan, Enchanted, GPT4All, MLC Chat, AnythingLLM e a maioria dos apps Electron/Tauri funcionam nativamente no Apple Silicon e usam o backend Metal. MLX-LM é específico da Apple e o mais rápido para modelos grandes em chips M-series. vLLM, TensorRT-LLM e ExLlamaV2 estão focados na NVIDIA e não funcionam ou funcionam mal no Apple Silicon.

Todas essas ferramentas suportam o formato de modelo GGUF?

GGUF é o formato nativo do llama.cpp e qualquer ferramenta que o envolva (Ollama, LM Studio, Jan, GPT4All, KoboldCpp, Llamafile). vLLM e TensorRT-LLM usam seus próprios formatos otimizados (tipicamente AWQ ou FP16) para maior desempenho. ExLlamaV2 usa quantização EXL2. MLX-LM usa pesos convertidos para MLX. A maioria das ferramentas listadas aceita GGUF; algumas (vLLM, TensorRT-LLM, ExLlamaV2, MLX-LM) requerem uma etapa de conversão única a partir dos pesos originais do Hugging Face.

Quais ferramentas são melhores para usuários sem experiência em código?

GPT4All tem a instalação mais simples (um clique, funciona com 8 GB RAM). LM Studio é a mais completa em recursos sem precisar de terminal. Jan é a opção sem código mais focada em privacidade. Para chat de documentos sem trabalho na linha de comando, AnythingLLM é a mais fácil. As quatro estão listadas na categoria de Aplicativos de desktop (GUI) acima.

Posso executar essas ferramentas em um servidor e acessá-las remotamente?

A maioria das ferramentas com capacidade de servidor (Ollama, vLLM, LocalAI, Open WebUI, LibreChat, PrivateGPT, AnythingLLM) expõe uma API HTTP e se vincula a uma interface de rede configurável nas configurações. Padrão padrão: executar o Ollama em um servidor doméstico ou VPS, executar uma interface no seu laptop ou telefone apontando para o IP do servidor. Trate a API como qualquer serviço web — vincular ao localhost por trás de um proxy reverso, ou a uma rede privada com autenticação adequada.

Quais ferramentas suportam configurações multiusuário / de equipe?

Open WebUI, LibreChat, h2oGPT, AnythingLLM (com recursos de administrador habilitados) e Dify são projetados para uso multiusuário, com controle de acesso baseado em funções e histórico de conversas por usuário. vLLM é a camada de serving correta por baixo quando a inferência concorrente importa — ele agrupa solicitações de múltiplos usuários para um desempenho inatingível com Ollama em concorrência acima de ~3.

Com que frequência este diretório é atualizado?

A cada seis meses — última revisão em julho de 2026, a próxima atualização programada é em novembro de 2026. As mudanças intermediárias (um projeto fica inativo, uma nova ferramenta ganha participação significativa, uma licença muda) são aplicadas como patches à entrada existente. Categorias ou camadas completamente novas aguardam uma revisão para manter a estrutura estável.

← Voltar para LLMs locais avançados