llama-bench: Das beste Tool zum Benchmarking lokaler LLM-Geschwindigkeit

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.
Schnelle Antwort
llama-bench, im Lieferumfang von llama.cpp, ist das beste Tool zum Benchmarking der Geschwindigkeit lokaler LLMs — es trennt Prompt-Verarbeitungsgeschwindigkeit von Generierungsgeschwindigkeit bei fester Kontextlänge und Quantisierungsstufe. Für einen schnellen Plausibilitätscheck Ihres aktuellen Setups nutzen Sie stattdessen die `--verbose`-Ausgabe von Ollama.
- ▸Bester Benchmark insgesamt: llama-bench — trennt Prompt-Verarbeitungsgeschwindigkeit von Generierungsgeschwindigkeit, kontrolliert Kontextlänge und Quantisierung.
- ▸Schnellster Plausibilitätscheck: Ollama --verbose — eine grobe Tokens/Sek.-Ablesung aus einer normalen Chat-Antwort, kein separates Benchmark-Werkzeug nötig.
- ▸Beste GUI-Option: LM Studio — eine Live-Anzeige der Tokens/Sek. beim Testen und Vergleichen von Modellen, keine Kommandozeile nötig.
- ▸Am besten für Hardwarevergleiche: llama-bench — die einzige Option hier, die für kontrollierte, wiederholbare Seite-an-Seite-Läufe gebaut ist.
Wichtigste Punkte
- ✓llama-bench ist das beste Benchmarking-Tool insgesamt — es trennt Prompt-Verarbeitungsgeschwindigkeit von Generierungsgeschwindigkeit unter festen, wiederholbaren Einstellungen
- ✓Die --verbose-Option von Ollama ist der schnellste Plausibilitätscheck für „ist mein Setup schnell genug", kein Ersatz für einen kontrollierten Hardwarevergleich
- ✓LM Studio ist die beste GUI-Option für schnelle Tests, Modell-Experimente und das Ansehen der Live-Leistung ohne Kommandozeile
- ✓Halten Sie Modell, Quantisierung und Kontextlänge zwischen Läufen identisch — der Vergleich unterschiedlicher Einstellungen ergibt eine bedeutungslose Zahl
- ✓Führen Sie mehrere Durchläufe aus und mitteln Sie das Ergebnis, und vertrauen Sie niemals einer bloßen Tokens/Sek.-Zahl aus dem Internet ohne die zugehörigen Einstellungen
Beste Wahl: llama-bench
llama-bench ist die richtige Standardwahl für alle, die eine wiederholbare, hardwarevergleichbare Geschwindigkeitszahl benötigen. Es ist Teil von llama.cpp, läuft über die Kommandozeile und meldet für jeden Test zwei getrennte Werte: Prompt-Verarbeitungsgeschwindigkeit (wie schnell das Modell die Eingabe liest) und Generierungsgeschwindigkeit (wie schnell es neue Tokens erzeugt). Diese beiden Werte verhalten sich unter Last sehr unterschiedlich, weshalb ein Tool, das sie zu einer Zahl vermischt, das halbe Bild verbirgt.
Greifen Sie zu llama-bench, wenn Sie zwei GPUs vor einem Kauf vergleichen, einen neuen Mac oder PC testen, Quantisierungsstufen vergleichen, Ergebnisse öffentlich veröffentlichen oder entscheiden, ob sich ein Hardware-Upgrade lohnt. Es wiederholt jeden Test automatisch und meldet den Durchschnitt, sodass Sie ihn nicht fünfmal von Hand ausführen müssen.
Die häufigste Anschlussfrage ist, was die Optionen für Kontextlänge und Prompt-/Generierungslänge eigentlich steuern. Kurz gesagt: llama-bench lässt Sie festlegen, wie lang der Testprompt ist und wie viele Tokens er erzeugt — unabhängig voneinander —, sodass Sie ein kurzes, chat-ähnliches Szenario oder ein langes, dokumentähnliches Szenario testen können, ohne sonst etwas am Lauf zu ändern. Genau diese Trennung macht zwei Ergebnisse überhaupt erst vergleichbar.
llama-bench ist kein kommerzielles Produkt — es ist ein kostenloser, quelloffener Teil des llama.cpp-Projekts auf GitHub, das automatisch enthalten ist, sobald Sie llama.cpp bauen oder installieren.
Schnelltest: Ollama --verbose
Die `--verbose`-Option von Ollama ist der schnellste Weg zu prüfen, ob sich Ihr aktuelles Setup schnell genug anfühlt — kein Ersatz für llama-bench. Der Befehl ollama run <model> --verbose gibt am Ende einer normalen Chat-Antwort einen Tokens/Sek.-Wert aus, ohne dass ein separater Benchmark-Schritt nötig ist.
Der Wert stammt aus einer einzelnen, unkontrollierten Generierung, nicht aus einem wiederholten Lauf mit festem Kontext, und ist daher verrauschter und nicht geeignet, um zwei unterschiedliche Hardware-Konfigurationen zu vergleichen. Nutzen Sie ihn, um „ist das gerade für Chat nutzbar" zu beantworten, und llama-bench, wenn die Antwort einem Vergleich mit einer anderen Maschine standhalten muss.
Ollama ist kostenlos und quelloffen — Installationshinweise finden Sie auf der Ollama-Website.
Beste GUI-Option: LM Studio
LM Studio ist die beste Wahl, wenn Sie eine Live-Anzeige der Tokens/Sek. wollen, ohne ein Terminal zu öffnen. Die Chat-Oberfläche zeigt die Generierungsgeschwindigkeit in Echtzeit an, was praktisch ist für schnelle Hardware-Checks, Modell-Experimente und den Vergleich von Quantisierungen nebeneinander während der Arbeit.
Wie die `--verbose`-Option von Ollama ist die Live-Anzeige von LM Studio praktisch, aber nicht streng — sie bietet nicht die Kontrolle über Laufanzahl oder Kontextlänge, die ein llama-bench-Ergebnis für eine Hardware-Kaufentscheidung vertrauenswürdig machen. LM Studio hat eine kostenlose Stufe; Downloads finden Sie auf der LM-Studio-Website.
Benchmarken vor dem Kauf
Die eigentliche Frage hinter den meisten Benchmarking-Suchen lautet nicht „welches Tool soll ich nutzen", sondern „welche Hardware soll ich kaufen". Eine allgemeine Tokens/Sek.-Zahl aus einem fremden Forenbeitrag beantwortet das nicht — führen Sie dasselbe Modell, dieselbe Quantisierung und dieselbe Kontextlänge auf beiden GPUs aus, die Sie tatsächlich in Betracht ziehen, bevor Sie entscheiden.
Sobald Sie echte Zahlen aus Ihren eigenen llama-bench-Läufen haben, vergleichen Sie diese mit den Optionen in unserem Ratgeber Beste GPUs für lokale LLMs, wenn Sie beim Desktop bleiben, unserem Ratgeber Beste Mini-PCs für lokale LLMs für eine kompakte Dauerlösung, oder unserem Ratgeber Apple Silicon vs. NVIDIA-GPU-Vergleich, wenn Sie Unified Memory statt einer diskreten GPU wollen.
Was einen Benchmark nützlich macht
Ein nützlicher Vergleich hält Modell, Quantisierungsstufe, Kontextlänge und Prompt-Inhalt zwischen Läufen konstant und meldet Prompt-Verarbeitungsgeschwindigkeit und Generierungsgeschwindigkeit getrennt. Ohne diese Kontrollen sagt eine einzelne Tokens/Sek.-Zahl fast nichts darüber aus, wie dasselbe Setup bei einem längeren Prompt oder einer anderen Quantisierung abschneidet.
Führen Sie mehrere Durchläufe aus und mitteln Sie das Ergebnis — ein einzelner Lauf wird durch thermisches Throttling, Hintergrundprozesse und Kaltstart-Ladezeiten verzerrt. Behandeln Sie eine nicht zugeordnete Tokens/Sek.-Zahl aus einem Forum oder Social-Media-Beitrag als grobe Anekdote, nicht als Benchmark, sofern nicht Modell, Quantisierung und Kontextlänge dabeistehen.
Fazit
Für einen ernsthaften, hardwarevergleichbaren Benchmark nutzen Sie llama-bench. Für einen schnellen Check Ihres aktuellen Setups nutzen Sie die `--verbose`-Ausgabe von Ollama. Für die einfachste GUI-Erfahrung mit Live-Leistungsanzeige nutzen Sie LM Studio. Und wenn es im Kern um eine Kaufentscheidung geht, benchmarken Sie das genaue Modell und die Quantisierung, die Ihnen wichtig sind, auf beiden Maschinen, bevor Sie sich festlegen — vergleichen Sie den Sieger dann mit unseren Ratgebern zu GPU, Mini-PC oder Mac.
Häufig gestellte Fragen
Was steuern die Optionen für Kontextgröße und Prompt/Generierung bei llama-bench?▾
Warum variieren Benchmark-Ergebnisse zwischen den Läufen?▾
Ist die Prompt-Verarbeitungsgeschwindigkeit oder die Generierungsgeschwindigkeit wichtiger?▾
Kann ich eine online gefundene Tokens/Sek.-Zahl mit meiner eigenen Hardware vergleichen?▾
Verwandte Prompt Bites
- ▸Wie viel VRAM brauchen Sie für ein lokales LLM?
- ▸Beste Quantisierung für 6 GB VRAM: Welche Stufe passt?
- ▸GGUF vs. GPTQ vs. AWQ: Welches Quantisierungsformat sollten Sie verwenden?
- ▸Die beste Preis-Leistungs-GPU für lokale LLMs zu VAE-/Golf-Preisen 2026
- ▸Was ist Spekulatives Dekodieren?
- ▸SGLang oder vLLM für lokales Model-Serving?