Principais conclusões
- 46 ferramentas, três tipos: mecanismos de inferência (30), runtimes e gerenciadores (13), roteadores e gateways (4). O Ollama aparece em dois grupos porque é ao mesmo tempo um mecanismo e um runtime.
- A tabela é gerada a partir do registro de cada ferramenta e conferida com o README ou o site oficial; um traço significa "não informado na documentação", nunca "não". Para algumas ferramentas conhecidas, a documentação citada aqui não menciona determinado recurso, então suas células mostram um traço.
- Cada nome de ferramenta na tabela leva à sua própria análise no PromptQuorum, onde estão as etapas de instalação e os limites.
📍 Em uma frase
Executar modelos localmente envolve três tipos de ferramenta — mecanismos de inferência, runtimes e gerenciadores, e roteadores e gateways — por isso as 46 ferramentas do diretório PromptQuorum são comparadas dentro de cada tipo, usando uma tabela gerada a partir dos mesmos dados de ferramenta da análise própria de cada uma.
💬 Em termos simples
Um mecanismo é a parte que de fato executa o modelo, um runtime ou gerenciador baixa e executa modelos para você, e um gateway roteia as requisições entre eles. Comparar um mecanismo com um gateway em suporte a GPU não faz sentido, por isso este guia compara itens do mesmo tipo.
Como comparamos
Os fatos de cada ferramenta — preço, licença, plataformas, requisitos de hardware e atributos específicos da categoria — são armazenados uma única vez, no registro da ferramenta no diretório. A tabela comparativa abaixo é gerada a partir desses registros, e a análise própria da ferramenta usa o mesmo registro, portanto as duas não podem informar valores diferentes.
Os atributos específicos da categoria (por exemplo, API compatível com OpenAI ou suporte a GPU AMD) foram extraídos do README ou do site oficial de cada projeto e conferidos com a redação exata de lá. Quando a documentação é omissa, a tabela mostra um traço em vez de adivinhar; quando a afirmação vem com ressalvas (experimental, planejada ou disponível apenas por meio de um projeto separado), o atributo fica fora da tabela e é tratado na análise da ferramenta.
Apenas ferramentas com análise própria no PromptQuorum estão na tabela. Ferramentas listadas apenas como servidores de API (h2oGPT, Tabby e OpenAI Edge TTS) são comparadas em suas próprias categorias. A comparação lista ferramentas que rodam no seu próprio hardware; ela não as classifica, porque a escolha certa depende da sua restrição.
Tabela comparativa
Escolha abaixo um tipo de ferramenta e leia ao longo de uma linha. Clique no nome de uma ferramenta para abrir a análise completa no PromptQuorum.
| Ferramenta | Preço | Licença | Plataformas | Execução | Hardware | Versão | API compatível com OpenAI | GPU NVIDIA | Apple Silicon | GPU AMD | Inferência em CPU | Multi-GPU / multinó | Análise | link de produto · divulgado |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| candle-vllm | Gratuito | MIT | macOS, Windows, Linux | Local | Varia conforme o modelo | v0.9.1 | Sim | Sim | Sim | — | — | Sim | Ler análise → | candle-vllm |
| claude-code-local | Gratuito | MIT | macOS | Local | Varia conforme o modelo | v0.3.0 | — | — | Sim | — | — | — | Ler análise → | claude-code-local |
| ExLlamaV2 | Gratuito | MIT | Windows, Linux | Local | 8 GB de VRAM | v0.3.2 | — | Sim | — | — | — | Sim | Ler análise → | ExLlamaV2 |
| exo | Gratuito | Apache-2.0 | macOS, Linux | Local | Varia conforme o modelo | — | Sim | — | Sim | — | Sim | Sim | Ler análise → | exo |
| KoboldCpp | Gratuito | AGPL-3.0 | Windows, Linux, macOS | Local | Varia conforme o modelo | v1.121 | Sim | Sim | Sim | Sim | Sim | — | Ler análise → | KoboldCpp |
| KServe | Gratuito | Apache-2.0 | Linux | Local | CPU é suficiente | v0.20.0 | Sim | — | — | — | — | Sim | Ler análise → | KServe |
| llama.cpp | Gratuito | MIT | macOS, Windows, Linux | Local | Varia conforme o modelo | v0.4.1 | Sim | Sim | Sim | Sim | Sim | — | Ler análise → | llama.cpp |
| Llamafile | Gratuito | Apache-2.0 | macOS, Windows, Linux | Local | Varia conforme o modelo | 0.10.6 | — | — | — | — | — | — | Ler análise → | Llamafile |
| LMDeploy | Gratuito | Apache-2.0 | Linux | Local | Varia conforme o modelo | v0.17.0 | — | Sim | — | — | — | Sim | Ler análise → | LMDeploy |
| LocalAI | Gratuito | MIT | macOS, Windows, Linux | Local | Varia conforme o modelo | — | Sim | Sim | Sim | Sim | Sim | Sim | Ler análise → | LocalAI |
| LoRAX | Gratuito | Apache-2.0 | Linux | Local | Varia conforme o modelo | v0.12.1 | Sim | Sim | — | — | — | Sim | Ler análise → | LoRAX |
| Lucebox | Gratuito | Apache-2.0 | Linux | Local | Varia conforme o modelo | — | Sim | Sim | — | Sim | — | Sim | Ler análise → | Lucebox |
| MLC LLM | Gratuito | Apache-2.0 | macOS, Windows, Linux, iOS, Android | Local | Varia conforme o modelo | — | Sim | Sim | Sim | Sim | — | — | Ler análise → | MLC LLM |
| MLX-LM | Gratuito | MIT | macOS | Local | Varia conforme o modelo | — | — | — | Sim | — | — | Sim | Ler análise → | MLX-LM |
| mlx-serve | Gratuito | MIT | macOS | Local | Varia conforme o modelo | v26.9.4 | Sim | — | Sim | — | — | — | Ler análise → | mlx-serve |
| mlxcel | Gratuito | Apache-2.0 | macOS, Linux | Local | Varia conforme o modelo | v0.7.0 | Sim | Sim | Sim | — | — | Sim | Ler análise → | mlxcel |
| NVIDIA Dynamo | Gratuito | Apache-2.0 | Linux | Local | Varia conforme o modelo | v1.4–v1.6 | Sim | — | — | — | — | Sim | Ler análise → | NVIDIA Dynamo |
| Ollama | Gratuito | MIT | macOS, Windows, Linux | Local | Varia conforme o modelo | — | — | — | — | — | — | — | Ler análise → | Ollama |
| OlliteRT | Gratuito | Apache-2.0 | Android | Local | CPU é suficiente | — | Sim | — | — | — | Sim | — | Ler análise → | OlliteRT |
| oMLX | Gratuito | Apache-2.0 | macOS | Local | Varia conforme o modelo | v0.6.4 | Sim | — | Sim | — | — | Sim | Ler análise → | oMLX |
| OpenLLM | Gratuito | Apache-2.0 | — | Híbrido | Varia conforme o modelo | — | Sim | — | — | — | — | — | Ler análise → | OpenLLM |
| Rapid-MLX | Gratuito | Apache-2.0 | macOS | Local | 8 GB de RAM | — | Sim | — | Sim | — | — | — | Ler análise → | Rapid-MLX |
| SGLang | Gratuito | Apache-2.0 | Linux | Local | Varia conforme o modelo | — | — | Sim | — | Sim | Sim | Sim | Ler análise → | SGLang |
| Shimmy | Gratuito | Apache-2.0 | macOS, Windows, Linux | Local | Varia conforme o modelo | — | Sim | Sim | Sim | Sim | — | — | Ler análise → | Shimmy |
| SwiftLM | Gratuito | MIT | macOS, iOS | Local | Varia conforme o modelo | — | Sim | — | Sim | — | — | — | Ler análise → | SwiftLM |
| TensorRT-LLM | Gratuito | Apache-2.0 | Windows, Linux | Local | Varia conforme o modelo | — | — | Sim | — | — | — | — | Ler análise → | TensorRT-LLM |
| text-generation-webui | Gratuito | AGPL-3.0 | Windows, Linux, macOS | Local | Varia conforme o modelo | — | Sim | Sim | Sim | Sim | Sim | — | Ler análise → | text-generation-webui |
| TurboFieldfare | Gratuito | Apache-2.0 | macOS | Local | 2 GB de RAM | — | — | — | Sim | — | — | — | Ler análise → | TurboFieldfare |
| vLLM | Gratuito | Apache-2.0 | Linux | Local | Varia conforme o modelo | — | Sim | Sim | — | Sim | Sim | Sim | Ler análise → | vLLM |
| vllm-mlx | Gratuito | Apache-2.0 | macOS | Local | Varia conforme o modelo | — | Sim | — | Sim | — | — | — | Ler análise → | vllm-mlx |
"—" significa que a documentação do próprio projeto não informa o dado, não que o recurso não exista. Os valores vêm do README ou do site oficial de cada projeto e são conferidos novamente quando a análise de uma ferramenta é atualizada.
Mecanismos de inferência: o que muda
- API compatível com OpenAI. candle-vllm, NVIDIA Dynamo, exo, KoboldCpp, KServe, llama.cpp, LocalAI, LoRAX, Lucebox, MLC LLM, mlx-serve, mlxcel, OlliteRT, oMLX, OpenLLM, Rapid-MLX, Shimmy, SwiftLM, text-generation-webui, vllm-mlx e vLLM documentam uma API HTTP compatível com OpenAI, então apps escritos para a API da OpenAI podem apontar para eles.
- GPUs NVIDIA. candle-vllm, ExLlamaV2, KoboldCpp, llama.cpp, LMDeploy, LocalAI, LoRAX, Lucebox, MLC LLM, mlxcel, SGLang, Shimmy, TensorRT-LLM, text-generation-webui e vLLM document NVIDIA GPU (CUDA) documentam suporte a GPU NVIDIA (CUDA).
- Apple Silicon. candle-vllm, claude-code-local, exo, KoboldCpp, llama.cpp, LocalAI, MLC LLM, MLX-LM, mlx-serve, mlxcel, oMLX, Rapid-MLX, Shimmy, SwiftLM, text-generation-webui, TurboFieldfare e vllm-mlx documentam suporte a Apple Silicon, Metal ou MLX.
- GPUs AMD. KoboldCpp, llama.cpp, LocalAI, Lucebox, MLC LLM, SGLang, Shimmy, text-generation-webui e vLLM documentam suporte a GPU AMD.
- Inferência em CPU. exo, KoboldCpp, llama.cpp, LocalAI, OlliteRT, SGLang, text-generation-webui e vLLM documentam a execução de inferência em CPU.
- Multi-GPU e multinó. candle-vllm, NVIDIA Dynamo, ExLlamaV2, exo, KServe, LMDeploy, LocalAI, LoRAX, Lucebox, MLX-LM, mlxcel, oMLX, SGLang e vLLM documentam inferência multi-GPU, tensor-paralela ou multinó.
- Licença. A maioria dos mecanismos aqui é Apache-2.0 (19 ferramentas) ou MIT (9); KoboldCpp e text-generation-webui são AGPL-3.0. Licenças copyleft impõem condições à distribuição de versões modificadas — veja Licenças de ferramentas de IA explicadas.
Runtimes e gerenciadores: o que muda
- API compatível com OpenAI. Docker Model Runner, Foundry Local, GPUStack, Jan, Lemonade e Osaurus documentam uma API compatível com OpenAI.
- App de desktop. GPT4All, Jan, LM Studio, Osaurus e Ypipe documentam um app de desktop instalável.
- Biblioteca de modelos integrada. Foundry Local, GPUStack, Jan, Lemonade, LM Studio e Ollama documentam uma forma integrada de encontrar e baixar modelos.
- Modo headless ou servidor. DreamServer, GPUStack, Lemonade e Osaurus documentam a execução como serviço em segundo plano ou servidor sem a interface gráfica.
- Licença e preço. Quatro runtimes aqui são Apache-2.0 e quatro são MIT. O LM Studio e o Docker Model Runner são proprietários (o LM Studio é gratuito para uso; o Docker Model Runner vem incluído no Docker Desktop), o Msty é de código fechado com um plano gratuito, e o RunAnywhere e o YPipe usam termos próprios ou não documentados — confira cada análise.
Roteadores e gateways: o que muda
- Endpoint compatível com OpenAI. AIClient2API e litellm documentam um endpoint compatível com OpenAI.
- Roteamento para modelos locais. litellm documents local or self-hosted models (such as Ollama) documenta modelos locais ou auto-hospedados (como o Ollama) entre os provedores compatíveis.
- Fallback e balanceamento de carga. AIClient2API, ClawRouter e litellm documentam fallback, novas tentativas ou balanceamento de carga entre modelos ou provedores.
- Licença. Dois dos quatro são MIT, um é GPL-3.0 e um é Apache-2.0.
O que esta comparação não pode dizer
- Ela compara capacidades documentadas, não desempenho. Não diz nada sobre tokens por segundo, uso de memória ou latência — o PromptQuorum não os mediu para essas ferramentas, e eles dependem muito do seu hardware e do seu modelo.
- Os traços são lacunas na documentação que verificamos, não achados negativos. Algumas ferramentas podem oferecer um recurso que o README não menciona; isso é mais visível em algumas ferramentas amplamente usadas cujos READMEs curtos informam pouco (por exemplo, os recursos de mecanismo do Ollama).
- O suporte de hardware é o que a documentação afirma, não uma garantia de boa experiência nesse hardware; leia a análise da ferramenta para os requisitos reais.
- As ferramentas mudam rápido. A análise de cada ferramenta informa a versão em que foi verificada, e este guia é atualizado quando uma análise é atualizada.
Perguntas frequentes
Qual é a diferença entre um mecanismo de inferência, um runtime e um gateway?
Um mecanismo de inferência executa o modelo no seu hardware (por exemplo, llama.cpp ou vLLM). Um runtime ou gerenciador baixa modelos e os executa para você, muitas vezes com um app de desktop ou uma biblioteca de modelos (por exemplo, Ollama ou LM Studio). Um roteador ou gateway fica na frente de um ou mais modelos ou provedores e encaminha as requisições. Eles fazem trabalhos diferentes, por isso são comparados separadamente.
O que significa um traço na tabela comparativa?
Significa que a documentação do próprio projeto não informa esse atributo. Não significa que o recurso não exista; consulte a análise da ferramenta ou o repositório dela.
Por que o Ollama está em dois grupos?
O Ollama é ao mesmo tempo um mecanismo de inferência e um runtime que gerencia modelos, por isso aparece nos dois. O README dele informa poucos dos atributos comparados aqui, então muitas de suas células mostram um traço.
Alguma dessas ferramentas tem link de afiliado?
Não. No momento da redação, o PromptQuorum não tem nenhuma relação de afiliado com nenhuma ferramenta desta comparação, e nenhum link aqui gera comissão.
Com que frequência esta comparação é atualizada?
Ela é atualizada duas vezes por ano e sempre que a análise de uma das ferramentas listadas é atualizada, porque a tabela é gerada a partir dos mesmos dados dessas análises.
Fontes
- O README ou site oficial de cada ferramenta, listado na análise da ferramenta no PromptQuorum (com link a partir da tabela comparativa).
- Diretório de apps de IA local do PromptQuorum — o registro a partir do qual cada linha da tabela é gerada.
- Licenças de ferramentas de IA explicadas — o que significam as famílias de licença citadas acima.