Skip to main content
PromptQuorum
Início/LLMs locais avançados/Mecanismos de inferência, runtimes e gateways locais comparados (2026): executar e servir modelos
Overview & Reference

Mecanismos de inferência, runtimes e gateways locais comparados (2026): executar e servir modelos

·10 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

As 46 ferramentas locais de execução e serviço do diretório PromptQuorum se dividem em três tipos que devem ser comparados separadamente: mecanismos de inferência (30 ferramentas), runtimes e gerenciadores (13) e roteadores e gateways (4). Entre os mecanismos, 15 documentam suporte a GPU NVIDIA, 17 documentam suporte a Apple Silicon e 21 documentam uma API compatível com OpenAI; entre os runtimes, 6 documentam uma API compatível com OpenAI. Use a tabela comparativa abaixo e leia a análise de cada ferramenta antes de instalá-la.

Executar um modelo no seu próprio hardware envolve três tipos diferentes de ferramenta — mecanismos de inferência que executam o modelo, runtimes e gerenciadores que baixam e executam modelos para você, e roteadores e gateways que ficam na frente deles — e nenhuma lista de recursos isolada os compara de forma justa. Este guia compara 46 ferramentas gratuitas e freemium, um tipo por vez, usando uma tabela comparativa gerada a partir dos mesmos dados da análise própria de cada ferramenta no PromptQuorum, de modo que a tabela e as análises não possam se contradizer.

Esta página contém links de referência para produtos de terceiros. O PromptQuorum não está inscrito em nenhum programa de afiliados — são links simples que não geram comissão. Clicar nos links e os próximos passos são de sua inteira responsabilidade. Estes links não representam qualquer endosso ou verificação por parte do PromptQuorum.

Principais conclusões

  • 46 ferramentas, três tipos: mecanismos de inferência (30), runtimes e gerenciadores (13), roteadores e gateways (4). O Ollama aparece em dois grupos porque é ao mesmo tempo um mecanismo e um runtime.
  • A tabela é gerada a partir do registro de cada ferramenta e conferida com o README ou o site oficial; um traço significa "não informado na documentação", nunca "não". Para algumas ferramentas conhecidas, a documentação citada aqui não menciona determinado recurso, então suas células mostram um traço.
  • Cada nome de ferramenta na tabela leva à sua própria análise no PromptQuorum, onde estão as etapas de instalação e os limites.

📍 Em uma frase

Executar modelos localmente envolve três tipos de ferramenta — mecanismos de inferência, runtimes e gerenciadores, e roteadores e gateways — por isso as 46 ferramentas do diretório PromptQuorum são comparadas dentro de cada tipo, usando uma tabela gerada a partir dos mesmos dados de ferramenta da análise própria de cada uma.

💬 Em termos simples

Um mecanismo é a parte que de fato executa o modelo, um runtime ou gerenciador baixa e executa modelos para você, e um gateway roteia as requisições entre eles. Comparar um mecanismo com um gateway em suporte a GPU não faz sentido, por isso este guia compara itens do mesmo tipo.

Como comparamos

Os fatos de cada ferramenta — preço, licença, plataformas, requisitos de hardware e atributos específicos da categoria — são armazenados uma única vez, no registro da ferramenta no diretório. A tabela comparativa abaixo é gerada a partir desses registros, e a análise própria da ferramenta usa o mesmo registro, portanto as duas não podem informar valores diferentes.

Os atributos específicos da categoria (por exemplo, API compatível com OpenAI ou suporte a GPU AMD) foram extraídos do README ou do site oficial de cada projeto e conferidos com a redação exata de lá. Quando a documentação é omissa, a tabela mostra um traço em vez de adivinhar; quando a afirmação vem com ressalvas (experimental, planejada ou disponível apenas por meio de um projeto separado), o atributo fica fora da tabela e é tratado na análise da ferramenta.

Apenas ferramentas com análise própria no PromptQuorum estão na tabela. Ferramentas listadas apenas como servidores de API (h2oGPT, Tabby e OpenAI Edge TTS) são comparadas em suas próprias categorias. A comparação lista ferramentas que rodam no seu próprio hardware; ela não as classifica, porque a escolha certa depende da sua restrição.

Tabela comparativa

Escolha abaixo um tipo de ferramenta e leia ao longo de uma linha. Clique no nome de uma ferramenta para abrir a análise completa no PromptQuorum.

FerramentaPreçoLicençaPlataformasExecuçãoHardwareVersãoAPI compatível com OpenAIGPU NVIDIAApple SiliconGPU AMDInferência em CPUMulti-GPU / multinóAnáliselink de produto · divulgado
candle-vllmGratuitoMITmacOS, Windows, LinuxLocalVaria conforme o modelov0.9.1SimSimSimSimLer análisecandle-vllm
claude-code-localGratuitoMITmacOSLocalVaria conforme o modelov0.3.0SimLer análiseclaude-code-local
ExLlamaV2GratuitoMITWindows, LinuxLocal8 GB de VRAMv0.3.2SimSimLer análiseExLlamaV2
exoGratuitoApache-2.0macOS, LinuxLocalVaria conforme o modeloSimSimSimSimLer análiseexo
KoboldCppGratuitoAGPL-3.0Windows, Linux, macOSLocalVaria conforme o modelov1.121SimSimSimSimSimLer análiseKoboldCpp
KServeGratuitoApache-2.0LinuxLocalCPU é suficientev0.20.0SimSimLer análiseKServe
llama.cppGratuitoMITmacOS, Windows, LinuxLocalVaria conforme o modelov0.4.1SimSimSimSimSimLer análisellama.cpp
LlamafileGratuitoApache-2.0macOS, Windows, LinuxLocalVaria conforme o modelo0.10.6Ler análiseLlamafile
LMDeployGratuitoApache-2.0LinuxLocalVaria conforme o modelov0.17.0SimSimLer análiseLMDeploy
LocalAIGratuitoMITmacOS, Windows, LinuxLocalVaria conforme o modeloSimSimSimSimSimSimLer análiseLocalAI
LoRAXGratuitoApache-2.0LinuxLocalVaria conforme o modelov0.12.1SimSimSimLer análiseLoRAX
LuceboxGratuitoApache-2.0LinuxLocalVaria conforme o modeloSimSimSimSimLer análiseLucebox
MLC LLMGratuitoApache-2.0macOS, Windows, Linux, iOS, AndroidLocalVaria conforme o modeloSimSimSimSimLer análiseMLC LLM
MLX-LMGratuitoMITmacOSLocalVaria conforme o modeloSimSimLer análiseMLX-LM
mlx-serveGratuitoMITmacOSLocalVaria conforme o modelov26.9.4SimSimLer análisemlx-serve
mlxcelGratuitoApache-2.0macOS, LinuxLocalVaria conforme o modelov0.7.0SimSimSimSimLer análisemlxcel
NVIDIA DynamoGratuitoApache-2.0LinuxLocalVaria conforme o modelov1.4–v1.6SimSimLer análiseNVIDIA Dynamo
OllamaGratuitoMITmacOS, Windows, LinuxLocalVaria conforme o modeloLer análiseOllama
OlliteRTGratuitoApache-2.0AndroidLocalCPU é suficienteSimSimLer análiseOlliteRT
oMLXGratuitoApache-2.0macOSLocalVaria conforme o modelov0.6.4SimSimSimLer análiseoMLX
OpenLLMGratuitoApache-2.0HíbridoVaria conforme o modeloSimLer análiseOpenLLM
Rapid-MLXGratuitoApache-2.0macOSLocal8 GB de RAMSimSimLer análiseRapid-MLX
SGLangGratuitoApache-2.0LinuxLocalVaria conforme o modeloSimSimSimSimLer análiseSGLang
ShimmyGratuitoApache-2.0macOS, Windows, LinuxLocalVaria conforme o modeloSimSimSimSimLer análiseShimmy
SwiftLMGratuitoMITmacOS, iOSLocalVaria conforme o modeloSimSimLer análiseSwiftLM
TensorRT-LLMGratuitoApache-2.0Windows, LinuxLocalVaria conforme o modeloSimLer análiseTensorRT-LLM
text-generation-webuiGratuitoAGPL-3.0Windows, Linux, macOSLocalVaria conforme o modeloSimSimSimSimSimLer análisetext-generation-webui
TurboFieldfareGratuitoApache-2.0macOSLocal2 GB de RAMSimLer análiseTurboFieldfare
vLLMGratuitoApache-2.0LinuxLocalVaria conforme o modeloSimSimSimSimSimLer análisevLLM
vllm-mlxGratuitoApache-2.0macOSLocalVaria conforme o modeloSimSimLer análisevllm-mlx

"—" significa que a documentação do próprio projeto não informa o dado, não que o recurso não exista. Os valores vêm do README ou do site oficial de cada projeto e são conferidos novamente quando a análise de uma ferramenta é atualizada.

Mecanismos de inferência: o que muda

Runtimes e gerenciadores: o que muda

  • API compatível com OpenAI. Docker Model Runner, Foundry Local, GPUStack, Jan, Lemonade e Osaurus documentam uma API compatível com OpenAI.
  • App de desktop. GPT4All, Jan, LM Studio, Osaurus e Ypipe documentam um app de desktop instalável.
  • Biblioteca de modelos integrada. Foundry Local, GPUStack, Jan, Lemonade, LM Studio e Ollama documentam uma forma integrada de encontrar e baixar modelos.
  • Modo headless ou servidor. DreamServer, GPUStack, Lemonade e Osaurus documentam a execução como serviço em segundo plano ou servidor sem a interface gráfica.
  • Licença e preço. Quatro runtimes aqui são Apache-2.0 e quatro são MIT. O LM Studio e o Docker Model Runner são proprietários (o LM Studio é gratuito para uso; o Docker Model Runner vem incluído no Docker Desktop), o Msty é de código fechado com um plano gratuito, e o RunAnywhere e o YPipe usam termos próprios ou não documentados — confira cada análise.

Roteadores e gateways: o que muda

  • Endpoint compatível com OpenAI. AIClient2API e litellm documentam um endpoint compatível com OpenAI.
  • Roteamento para modelos locais. litellm documents local or self-hosted models (such as Ollama) documenta modelos locais ou auto-hospedados (como o Ollama) entre os provedores compatíveis.
  • Fallback e balanceamento de carga. AIClient2API, ClawRouter e litellm documentam fallback, novas tentativas ou balanceamento de carga entre modelos ou provedores.
  • Licença. Dois dos quatro são MIT, um é GPL-3.0 e um é Apache-2.0.

O que esta comparação não pode dizer

  • Ela compara capacidades documentadas, não desempenho. Não diz nada sobre tokens por segundo, uso de memória ou latência — o PromptQuorum não os mediu para essas ferramentas, e eles dependem muito do seu hardware e do seu modelo.
  • Os traços são lacunas na documentação que verificamos, não achados negativos. Algumas ferramentas podem oferecer um recurso que o README não menciona; isso é mais visível em algumas ferramentas amplamente usadas cujos READMEs curtos informam pouco (por exemplo, os recursos de mecanismo do Ollama).
  • O suporte de hardware é o que a documentação afirma, não uma garantia de boa experiência nesse hardware; leia a análise da ferramenta para os requisitos reais.
  • As ferramentas mudam rápido. A análise de cada ferramenta informa a versão em que foi verificada, e este guia é atualizado quando uma análise é atualizada.

Perguntas frequentes

Qual é a diferença entre um mecanismo de inferência, um runtime e um gateway?

Um mecanismo de inferência executa o modelo no seu hardware (por exemplo, llama.cpp ou vLLM). Um runtime ou gerenciador baixa modelos e os executa para você, muitas vezes com um app de desktop ou uma biblioteca de modelos (por exemplo, Ollama ou LM Studio). Um roteador ou gateway fica na frente de um ou mais modelos ou provedores e encaminha as requisições. Eles fazem trabalhos diferentes, por isso são comparados separadamente.

O que significa um traço na tabela comparativa?

Significa que a documentação do próprio projeto não informa esse atributo. Não significa que o recurso não exista; consulte a análise da ferramenta ou o repositório dela.

Por que o Ollama está em dois grupos?

O Ollama é ao mesmo tempo um mecanismo de inferência e um runtime que gerencia modelos, por isso aparece nos dois. O README dele informa poucos dos atributos comparados aqui, então muitas de suas células mostram um traço.

Alguma dessas ferramentas tem link de afiliado?

Não. No momento da redação, o PromptQuorum não tem nenhuma relação de afiliado com nenhuma ferramenta desta comparação, e nenhum link aqui gera comissão.

Com que frequência esta comparação é atualizada?

Ela é atualizada duas vezes por ano e sempre que a análise de uma das ferramentas listadas é atualizada, porque a tabela é gerada a partir dos mesmos dados dessas análises.

Fontes

← Voltar para LLMs locais avançados