Skip to main content
PromptQuorum

llama-bench: Das beste Tool zum Benchmarking lokaler LLM-Geschwindigkeit

llama-bench: Das beste Tool zum Benchmarking lokaler LLM-Geschwindigkeit

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.

Schnelle Antwort

llama-bench, im Lieferumfang von llama.cpp, ist das beste Tool zum Benchmarking der Geschwindigkeit lokaler LLMs — es trennt Prompt-Verarbeitungsgeschwindigkeit von Generierungsgeschwindigkeit bei fester Kontextlänge und Quantisierungsstufe. Für einen schnellen Plausibilitätscheck Ihres aktuellen Setups nutzen Sie stattdessen die `--verbose`-Ausgabe von Ollama.

  • Bester Benchmark insgesamt: llama-bench — trennt Prompt-Verarbeitungsgeschwindigkeit von Generierungsgeschwindigkeit, kontrolliert Kontextlänge und Quantisierung.
  • Schnellster Plausibilitätscheck: Ollama --verbose — eine grobe Tokens/Sek.-Ablesung aus einer normalen Chat-Antwort, kein separates Benchmark-Werkzeug nötig.
  • Beste GUI-Option: LM Studio — eine Live-Anzeige der Tokens/Sek. beim Testen und Vergleichen von Modellen, keine Kommandozeile nötig.
  • Am besten für Hardwarevergleiche: llama-bench — die einzige Option hier, die für kontrollierte, wiederholbare Seite-an-Seite-Läufe gebaut ist.
Tool ComparisonsFortgeschritten

Wichtigste Punkte

  • llama-bench ist das beste Benchmarking-Tool insgesamt — es trennt Prompt-Verarbeitungsgeschwindigkeit von Generierungsgeschwindigkeit unter festen, wiederholbaren Einstellungen
  • Die --verbose-Option von Ollama ist der schnellste Plausibilitätscheck für „ist mein Setup schnell genug", kein Ersatz für einen kontrollierten Hardwarevergleich
  • LM Studio ist die beste GUI-Option für schnelle Tests, Modell-Experimente und das Ansehen der Live-Leistung ohne Kommandozeile
  • Halten Sie Modell, Quantisierung und Kontextlänge zwischen Läufen identisch — der Vergleich unterschiedlicher Einstellungen ergibt eine bedeutungslose Zahl
  • Führen Sie mehrere Durchläufe aus und mitteln Sie das Ergebnis, und vertrauen Sie niemals einer bloßen Tokens/Sek.-Zahl aus dem Internet ohne die zugehörigen Einstellungen

Beste Wahl: llama-bench

llama-bench ist die richtige Standardwahl für alle, die eine wiederholbare, hardwarevergleichbare Geschwindigkeitszahl benötigen. Es ist Teil von llama.cpp, läuft über die Kommandozeile und meldet für jeden Test zwei getrennte Werte: Prompt-Verarbeitungsgeschwindigkeit (wie schnell das Modell die Eingabe liest) und Generierungsgeschwindigkeit (wie schnell es neue Tokens erzeugt). Diese beiden Werte verhalten sich unter Last sehr unterschiedlich, weshalb ein Tool, das sie zu einer Zahl vermischt, das halbe Bild verbirgt.

Greifen Sie zu llama-bench, wenn Sie zwei GPUs vor einem Kauf vergleichen, einen neuen Mac oder PC testen, Quantisierungsstufen vergleichen, Ergebnisse öffentlich veröffentlichen oder entscheiden, ob sich ein Hardware-Upgrade lohnt. Es wiederholt jeden Test automatisch und meldet den Durchschnitt, sodass Sie ihn nicht fünfmal von Hand ausführen müssen.

Die häufigste Anschlussfrage ist, was die Optionen für Kontextlänge und Prompt-/Generierungslänge eigentlich steuern. Kurz gesagt: llama-bench lässt Sie festlegen, wie lang der Testprompt ist und wie viele Tokens er erzeugt — unabhängig voneinander —, sodass Sie ein kurzes, chat-ähnliches Szenario oder ein langes, dokumentähnliches Szenario testen können, ohne sonst etwas am Lauf zu ändern. Genau diese Trennung macht zwei Ergebnisse überhaupt erst vergleichbar.

llama-bench ist kein kommerzielles Produkt — es ist ein kostenloser, quelloffener Teil des llama.cpp-Projekts auf GitHub, das automatisch enthalten ist, sobald Sie llama.cpp bauen oder installieren.

Schnelltest: Ollama --verbose

Die `--verbose`-Option von Ollama ist der schnellste Weg zu prüfen, ob sich Ihr aktuelles Setup schnell genug anfühlt — kein Ersatz für llama-bench. Der Befehl ollama run <model> --verbose gibt am Ende einer normalen Chat-Antwort einen Tokens/Sek.-Wert aus, ohne dass ein separater Benchmark-Schritt nötig ist.

Der Wert stammt aus einer einzelnen, unkontrollierten Generierung, nicht aus einem wiederholten Lauf mit festem Kontext, und ist daher verrauschter und nicht geeignet, um zwei unterschiedliche Hardware-Konfigurationen zu vergleichen. Nutzen Sie ihn, um „ist das gerade für Chat nutzbar" zu beantworten, und llama-bench, wenn die Antwort einem Vergleich mit einer anderen Maschine standhalten muss.

Ollama ist kostenlos und quelloffen — Installationshinweise finden Sie auf der Ollama-Website.

Beste GUI-Option: LM Studio

LM Studio ist die beste Wahl, wenn Sie eine Live-Anzeige der Tokens/Sek. wollen, ohne ein Terminal zu öffnen. Die Chat-Oberfläche zeigt die Generierungsgeschwindigkeit in Echtzeit an, was praktisch ist für schnelle Hardware-Checks, Modell-Experimente und den Vergleich von Quantisierungen nebeneinander während der Arbeit.

Wie die `--verbose`-Option von Ollama ist die Live-Anzeige von LM Studio praktisch, aber nicht streng — sie bietet nicht die Kontrolle über Laufanzahl oder Kontextlänge, die ein llama-bench-Ergebnis für eine Hardware-Kaufentscheidung vertrauenswürdig machen. LM Studio hat eine kostenlose Stufe; Downloads finden Sie auf der LM-Studio-Website.

Benchmarken vor dem Kauf

Die eigentliche Frage hinter den meisten Benchmarking-Suchen lautet nicht „welches Tool soll ich nutzen", sondern „welche Hardware soll ich kaufen". Eine allgemeine Tokens/Sek.-Zahl aus einem fremden Forenbeitrag beantwortet das nicht — führen Sie dasselbe Modell, dieselbe Quantisierung und dieselbe Kontextlänge auf beiden GPUs aus, die Sie tatsächlich in Betracht ziehen, bevor Sie entscheiden.

Sobald Sie echte Zahlen aus Ihren eigenen llama-bench-Läufen haben, vergleichen Sie diese mit den Optionen in unserem Ratgeber Beste GPUs für lokale LLMs, wenn Sie beim Desktop bleiben, unserem Ratgeber Beste Mini-PCs für lokale LLMs für eine kompakte Dauerlösung, oder unserem Ratgeber Apple Silicon vs. NVIDIA-GPU-Vergleich, wenn Sie Unified Memory statt einer diskreten GPU wollen.

Was einen Benchmark nützlich macht

Ein nützlicher Vergleich hält Modell, Quantisierungsstufe, Kontextlänge und Prompt-Inhalt zwischen Läufen konstant und meldet Prompt-Verarbeitungsgeschwindigkeit und Generierungsgeschwindigkeit getrennt. Ohne diese Kontrollen sagt eine einzelne Tokens/Sek.-Zahl fast nichts darüber aus, wie dasselbe Setup bei einem längeren Prompt oder einer anderen Quantisierung abschneidet.

Führen Sie mehrere Durchläufe aus und mitteln Sie das Ergebnis — ein einzelner Lauf wird durch thermisches Throttling, Hintergrundprozesse und Kaltstart-Ladezeiten verzerrt. Behandeln Sie eine nicht zugeordnete Tokens/Sek.-Zahl aus einem Forum oder Social-Media-Beitrag als grobe Anekdote, nicht als Benchmark, sofern nicht Modell, Quantisierung und Kontextlänge dabeistehen.

Fazit

Für einen ernsthaften, hardwarevergleichbaren Benchmark nutzen Sie llama-bench. Für einen schnellen Check Ihres aktuellen Setups nutzen Sie die `--verbose`-Ausgabe von Ollama. Für die einfachste GUI-Erfahrung mit Live-Leistungsanzeige nutzen Sie LM Studio. Und wenn es im Kern um eine Kaufentscheidung geht, benchmarken Sie das genaue Modell und die Quantisierung, die Ihnen wichtig sind, auf beiden Maschinen, bevor Sie sich festlegen — vergleichen Sie den Sieger dann mit unseren Ratgebern zu GPU, Mini-PC oder Mac.

Häufig gestellte Fragen

Was steuern die Optionen für Kontextgröße und Prompt/Generierung bei llama-bench?
llama-bench lässt Sie festlegen, wie viele Tokens der Testprompt enthält und wie viele Tokens erzeugt werden — unabhängig von der für den Lauf genutzten Kontextlänge —, sodass Sie ein Szenario mit kurzem oder langem Kontext testen können, ohne sonst etwas am Setup zu ändern. Genau diese Kontrolle über die Einstellungen hält zwei Läufe vergleichbar.
Warum variieren Benchmark-Ergebnisse zwischen den Läufen?
Thermisches Throttling, Hintergrundprozesse und Kaltstart-Ladezeiten des Modells beeinflussen alle Einzellaufergebnisse. Mitteln Sie mehrere Läufe — llama-bench macht das automatisch — statt einer einzelnen Stichprobe zu vertrauen.
Ist die Prompt-Verarbeitungsgeschwindigkeit oder die Generierungsgeschwindigkeit wichtiger?
Das hängt von der Aufgabe ab. Die Zusammenfassung langer Dokumente wird von der Prompt-Verarbeitungsgeschwindigkeit dominiert, da der Großteil der Arbeit im Lesen der Eingabe besteht. Interaktiver Chat wird von der Generierungsgeschwindigkeit dominiert, da das Modell die meiste Ausgabe Token für Token nach einem kurzen Prompt erzeugt.
Kann ich eine online gefundene Tokens/Sek.-Zahl mit meiner eigenen Hardware vergleichen?
Nur, wenn Modell, Quantisierungsstufe und Kontextlänge exakt übereinstimmen. Eine Tokens/Sek.-Zahl ohne diese Angaben ist mit Ihrem Setup nicht vergleichbar — behandeln Sie nicht zugeordnete Zahlen aus Foren oder sozialen Medien als grobe Anekdoten, nicht als Benchmarks.