Skip to main content
PromptQuorum

llama-bench: a melhor ferramenta para medir a velocidade de um LLM local

llama-bench: a melhor ferramenta para medir a velocidade de um LLM local

Esta página contém links de referência para produtos de terceiros. O PromptQuorum não está inscrito em nenhum programa de afiliados — são links simples que não geram comissão. Clicar nos links e os próximos passos são de sua inteira responsabilidade. Estes links não representam qualquer endosso ou verificação por parte do PromptQuorum.

Resposta rápida

O llama-bench, incluído com o llama.cpp, é a melhor ferramenta para medir a velocidade de um LLM local — separa a velocidade de processamento do prompt da velocidade de geração sob um comprimento de contexto e nível de quantização fixos. Para uma verificação rápida da sua configuração atual, use a saída `--verbose` do Ollama.

  • Melhor benchmark geral: llama-bench — separa a velocidade de processamento do prompt da velocidade de geração, controla o comprimento de contexto e a quantização.
  • Verificação mais rápida: Ollama --verbose — um número aproximado de tokens/seg a partir de uma resposta de chat normal, sem ferramenta de benchmark separada.
  • Melhor opção de interface: LM Studio — uma leitura ao vivo de tokens/seg enquanto você testa e compara modelos, sem linha de comando.
  • Melhor para comparações de hardware: llama-bench — a única opção aqui feita para execuções controladas e reproduzíveis lado a lado.
Tool ComparisonsIntermediário

Pontos principais

  • O llama-bench é a melhor ferramenta de benchmark no geral — separa a velocidade de processamento do prompt da velocidade de geração sob configurações fixas e reproduzíveis
  • A flag --verbose do Ollama é a verificação mais rápida para saber se sua configuração é rápida o suficiente, não um substituto para uma comparação de hardware controlada
  • O LM Studio é a melhor opção de interface para testes rápidos, experimentação de modelos e visualização de desempenho ao vivo sem linha de comando
  • Mantenha modelo, quantização e comprimento de contexto idênticos entre execuções — comparar configurações diferentes gera um número sem sentido
  • Execute várias passagens e calcule a média do resultado, e nunca confie em um número de tokens/seg encontrado online sem suas configurações associadas

Melhor escolha: llama-bench

O llama-bench é a escolha padrão certa para quem precisa de um número de velocidade repetível e comparável entre hardwares. Ele faz parte do llama.cpp, roda pela linha de comando e reporta dois números separados para cada teste: velocidade de processamento do prompt (quão rápido o modelo lê a entrada) e velocidade de geração (quão rápido ele produz novos tokens). Esses dois números se comportam de forma muito diferente sob carga, então uma ferramenta que os combina em um único número esconde metade do quadro.

Recorra ao llama-bench ao comparar duas GPUs antes de uma compra, testar um novo Mac ou PC, comparar níveis de quantização, publicar resultados, ou decidir se um upgrade de hardware vale a pena. Ele repete cada teste automaticamente e reporta a média, então você não precisa rodá-lo cinco vezes manualmente.

A pergunta de acompanhamento mais comum é o que as opções de comprimento de contexto e comprimento de prompt/geração realmente controlam. Resumindo: o llama-bench permite fixar o tamanho do prompt de teste e quantos tokens ele gera, de forma independente um do outro, para que você possa testar uma troca curta tipo chat ou um prompt longo tipo documento sem mudar mais nada na execução — essa separação é o que torna dois resultados comparáveis.

O llama-bench não é um produto comercial — é uma parte gratuita e de código aberto do projeto llama.cpp no GitHub, incluído automaticamente sempre que você compila ou instala o llama.cpp.

Teste rápido: Ollama --verbose

A flag `--verbose` do Ollama é a forma mais rápida de verificar se sua configuração atual parece rápida o suficiente — não um substituto para o llama-bench. Rodar ollama run <model> --verbose imprime um número de tokens/seg ao final de uma resposta de chat normal, sem exigir uma etapa de benchmark separada.

O número vem de uma única geração não controlada, não de uma execução repetida com contexto fixo, então é mais ruidoso e não é adequado para comparar dois hardwares diferentes. Use-o para responder "isso é utilizável para chat agora mesmo", e use o llama-bench quando a resposta precisar se sustentar contra outra máquina.

O Ollama é gratuito e de código aberto — veja o site do Ollama para instruções de instalação.

Melhor opção de interface: LM Studio

O LM Studio é a melhor escolha se você quiser uma leitura ao vivo de tokens/seg sem tocar em um terminal. Sua interface de chat mostra a velocidade de geração em tempo real, o que é conveniente para checagens rápidas de hardware, experimentação de modelos e comparação de quantizações lado a lado enquanto você trabalha.

Assim como a flag `--verbose` do Ollama, a leitura ao vivo do LM Studio é conveniente, não rigorosa — não expõe os controles de número de execuções ou comprimento de contexto que tornam um resultado do llama-bench confiável para uma decisão de compra de hardware. O LM Studio tem um plano gratuito; downloads no site do LM Studio.

Faça benchmark antes de comprar

A pergunta real por trás da maioria das buscas por benchmark não é "qual ferramenta devo usar", e sim "qual hardware devo comprar". Um número genérico de tokens/seg do post de um estranho não responde isso — rode o mesmo modelo, quantização e comprimento de contexto nas duas GPUs que você realmente está considerando antes de decidir.

Depois de ter números reais das suas próprias execuções do llama-bench, compare-os com as opções do nosso guia de melhores GPUs para LLMs locais se você for continuar no desktop, nosso guia de melhores mini PCs para LLMs locais para uma máquina compacta sempre ligada, ou nosso guia do comparativo Apple Silicon vs. GPU NVIDIA se você quiser memória unificada em vez de uma GPU discreta.

O que torna um benchmark útil

Uma comparação útil mantém modelo, nível de quantização, comprimento de contexto e conteúdo do prompt constantes entre execuções, e reporta a velocidade de processamento do prompt e a velocidade de geração separadamente. Sem esses controles, um único número de tokens/seg quase não diz nada sobre como a mesma configuração se sai com um prompt mais longo ou uma quantização diferente.

Execute várias passagens e calcule a média do resultado — uma única execução é distorcida por throttling térmico, processos em segundo plano e carregamento a frio do modelo. Trate um número de tokens/seg não atribuído de um fórum ou post de rede social como uma anedota aproximada, não como um benchmark, a menos que o modelo, a quantização e o comprimento de contexto estejam declarados junto.

Conclusão

Para um benchmark sério e comparável entre hardwares, use o llama-bench. Para uma checagem rápida da sua configuração atual, use a saída `--verbose` do Ollama. Para a experiência de interface mais fácil com visualização de desempenho ao vivo, use o LM Studio. E se o objetivo real é decidir o que comprar, faça benchmark do modelo e da quantização exatos que importam para você nas duas máquinas antes de se comprometer — depois compare o vencedor com nossos guias de GPU, mini PC ou Mac.

Perguntas frequentes

O que as opções de tamanho de contexto e prompt/geração do llama-bench controlam?
O llama-bench permite fixar quantos tokens o prompt de teste tem e quantos tokens ele gera, independentemente do comprimento de contexto usado na execução — assim você pode testar um cenário de contexto curto ou longo sem mudar mais nada na configuração. Esse controle sobre as configurações é o que mantém duas execuções comparáveis.
Por que os resultados de benchmark variam entre execuções?
Throttling térmico, processos em segundo plano e o carregamento a frio do modelo afetam os resultados de uma única execução. Calcule a média de várias execuções — o llama-bench faz isso automaticamente — em vez de confiar em uma única amostra.
A velocidade de processamento do prompt ou a velocidade de geração é mais importante?
Depende da tarefa. A sumarização de documentos longos é dominada pela velocidade de processamento do prompt, já que a maior parte do trabalho é ler a entrada. O chat interativo é dominado pela velocidade de geração, já que o modelo produz a maior parte da saída token por token após um prompt curto.
Posso comparar um número de tokens/seg que encontro online com o meu próprio hardware?
Somente se o modelo, o nível de quantização e o comprimento de contexto coincidirem exatamente. Um número de tokens/seg sem esses detalhes não é comparável à sua configuração — trate números não atribuídos de fóruns ou redes sociais como anedotas aproximadas, não como benchmarks.