llama-bench : le meilleur outil pour mesurer la vitesse d'un LLM local

Cette page contient des liens de référence vers des produits tiers. PromptQuorum n'est inscrit à aucun programme d'affiliation — ce sont de simples liens qui ne génèrent aucune commission. Cliquer sur les liens et vos prochaines étapes relèvent entièrement de votre responsabilité. Ces liens ne représentent aucune approbation ou vérification par PromptQuorum.
Réponse rapide
llama-bench, inclus avec llama.cpp, est le meilleur outil pour mesurer la vitesse d'un LLM local — il sépare la vitesse de traitement du prompt de la vitesse de génération à longueur de contexte et niveau de quantification fixes. Pour une vérification rapide de votre configuration actuelle, utilisez plutôt la sortie `--verbose` d'Ollama.
- ▸Meilleur benchmark global : llama-bench — sépare la vitesse de traitement du prompt de la vitesse de génération, contrôle la longueur de contexte et la quantification.
- ▸Vérification la plus rapide : Ollama --verbose — un chiffre approximatif de tokens/sec issu d'une réponse de chat normale, sans dispositif de benchmark séparé.
- ▸Meilleure interface graphique : LM Studio — un affichage en direct des tokens/sec pendant que vous testez et comparez des modèles, sans ligne de commande.
- ▸Meilleur pour les comparaisons matérielles : llama-bench — la seule option ici conçue pour des exécutions côte à côte, contrôlées et reproductibles.
Points clés
- ✓llama-bench est le meilleur outil de benchmark dans l'ensemble — il sépare la vitesse de traitement du prompt de la vitesse de génération sous des paramètres fixes et reproductibles
- ✓L'option --verbose d'Ollama est la vérification la plus rapide pour savoir si votre configuration est assez rapide, pas un substitut à une comparaison matérielle contrôlée
- ✓LM Studio est la meilleure interface graphique pour des tests rapides, l'expérimentation de modèles et l'affichage des performances en direct sans ligne de commande
- ✓Gardez le modèle, la quantification et la longueur de contexte identiques entre les exécutions — comparer des paramètres différents produit un chiffre dénué de sens
- ✓Effectuez plusieurs passages et faites la moyenne du résultat, et ne faites jamais confiance à un chiffre de tokens/sec trouvé en ligne sans ses paramètres associés
Meilleur choix : llama-bench
llama-bench est le choix par défaut pour quiconque a besoin d'un chiffre de vitesse reproductible et comparable entre configurations matérielles. Il fait partie de llama.cpp, s'exécute en ligne de commande et indique deux chiffres distincts pour chaque test : la vitesse de traitement du prompt (la rapidité avec laquelle le modèle lit l'entrée) et la vitesse de génération (la rapidité avec laquelle il produit de nouveaux tokens). Ces deux chiffres se comportent très différemment sous charge, donc un outil qui les combine en un seul chiffre cache la moitié de l'image.
Utilisez llama-bench pour comparer deux GPU avant un achat, tester un nouveau Mac ou PC, comparer des niveaux de quantification, publier des résultats, ou décider si une mise à niveau matérielle en vaut la peine. Il répète chaque test automatiquement et indique la moyenne, vous n'avez donc pas besoin de l'exécuter cinq fois à la main.
La question la plus fréquente concerne ce que contrôlent réellement les options de longueur de contexte et de longueur de prompt/génération. En bref : llama-bench vous permet de fixer la longueur du prompt de test et le nombre de tokens générés, indépendamment l'un de l'autre, afin de tester un échange court de type chat ou un prompt long de type document sans changer quoi que ce soit d'autre dans l'exécution — c'est cette séparation qui rend deux résultats comparables.
llama-bench n'est pas un produit commercial — c'est un composant gratuit et open source du projet llama.cpp sur GitHub, inclus automatiquement dès que vous compilez ou installez llama.cpp.
Test rapide : Ollama --verbose
L'option `--verbose` d'Ollama est le moyen le plus rapide de vérifier si votre configuration actuelle est suffisamment rapide — pas un remplacement pour llama-bench. La commande ollama run <model> --verbose affiche un chiffre de tokens/sec à la fin d'une réponse de chat normale, sans étape de benchmark séparée.
Le chiffre provient d'une seule génération non contrôlée, pas d'une exécution répétée à contexte fixe, il est donc plus bruité et inadapté pour comparer deux matériels différents. Utilisez-le pour répondre à « est-ce utilisable pour du chat en ce moment », et llama-bench quand la réponse doit tenir face à une autre machine.
Ollama est gratuit et open source — consultez le site d'Ollama pour les instructions d'installation.
Meilleure interface graphique : LM Studio
LM Studio est le meilleur choix si vous voulez un affichage en direct des tokens/sec sans toucher à un terminal. Son interface de chat affiche la vitesse de génération en temps réel, ce qui est pratique pour des vérifications matérielles rapides, l'expérimentation de modèles et la comparaison de quantifications côte à côte pendant le travail.
Comme l'option `--verbose` d'Ollama, l'affichage en direct de LM Studio est pratique plutôt que rigoureux — il n'offre pas les contrôles de nombre d'exécutions ou de longueur de contexte qui rendent un résultat llama-bench fiable pour une décision d'achat matériel. LM Studio propose un niveau gratuit ; téléchargements sur le site de LM Studio.
Benchmarker avant d'acheter
La vraie question derrière la plupart des recherches de benchmark n'est pas « quel outil utiliser », mais « quel matériel acheter ». Un chiffre générique de tokens/sec issu du post d'un inconnu n'y répond pas — exécutez le même modèle, la même quantification et la même longueur de contexte sur les deux GPU que vous envisagez réellement avant de décider.
Une fois que vous avez de vrais chiffres issus de vos propres exécutions llama-bench, comparez-les aux options de notre guide meilleurs GPU pour LLM locaux si vous restez sur un poste fixe, notre guide meilleurs mini-PC pour LLM locaux pour un boîtier compact toujours allumé, ou notre guide comparatif Apple Silicon vs GPU NVIDIA si vous voulez de la mémoire unifiée plutôt qu'un GPU discret.
Ce qui rend un benchmark utile
Une comparaison utile maintient constants le modèle, le niveau de quantification, la longueur de contexte et le contenu du prompt entre les exécutions, et indique séparément la vitesse de traitement du prompt et la vitesse de génération. Sans ces contrôles, un chiffre unique de tokens/sec ne dit presque rien sur la performance de la même configuration avec un prompt plus long ou une quantification différente.
Effectuez plusieurs passages et faites la moyenne du résultat — une seule exécution est faussée par le throttling thermique, les processus en arrière-plan et le chargement à froid du modèle. Traitez un chiffre de tokens/sec non attribué issu d'un forum ou d'un réseau social comme une anecdote approximative, pas comme un benchmark, sauf si le modèle, la quantification et la longueur de contexte sont précisés.
Conclusion
Pour un benchmark sérieux et comparable entre matériels, utilisez llama-bench. Pour une vérification rapide de votre configuration actuelle, utilisez la sortie `--verbose` d'Ollama. Pour l'expérience d'interface graphique la plus simple avec affichage des performances en direct, utilisez LM Studio. Et si l'objectif réel est de décider quoi acheter, benchmarkez le modèle et la quantification exacts qui vous intéressent sur les deux machines avant de vous engager — puis comparez le gagnant à nos guides GPU, mini-PC ou Mac.
Questions fréquentes
Que contrôlent les options de taille de contexte et de prompt/génération de llama-bench ?▾
Pourquoi les résultats de benchmark varient-ils d'une exécution à l'autre ?▾
La vitesse de traitement du prompt ou la vitesse de génération est-elle la plus importante ?▾
Puis-je comparer un chiffre de tokens/sec trouvé en ligne à mon propre matériel ?▾
Prompt Bites associés
- ▸De combien de VRAM avez-vous besoin pour un LLM local ?
- ▸Meilleure quantisation pour 6 Go de VRAM : quel niveau choisir ?
- ▸GGUF vs GPTQ vs AWQ : quel format de quantification utiliser ?
- ▸Le meilleur GPU qualité-prix pour LLM locaux aux prix du Golfe/EAU en 2026
- ▸Qu'est-ce que le décodage spéculatif ?
- ▸SGLang ou vLLM pour le serving local de modèles ?