Wichtigste Erkenntnisse
- Entwickelt von Georgi Gerganov im Jahr 2022; heute unter der ggml-org-Organisation auf GitHub gepflegt.
- MIT-Lizenz — kostenlose Nutzung, Veränderung und Weiterverbreitung, auch kommerziell.
- Läuft auf CPU, Apple Metal/Core ML, NVIDIA CUDA, Vulkan, OpenVINO, AMD ROCm und Ascend-NPU-Backends.
- Keine Python-Laufzeitumgebung erforderlich — als kompiliertes C/C++-Binary mit optionalen Python-Bindings.
- Unterstützt Echtzeit-Mikrofontranskription über das Stream-Beispiel, zusätzlich zur Batch-Transkription von Dateien.
- Aktuelle stabile Version: v1.9.3, veröffentlicht am 20. August 2026.
📍 In einem Satz
whisper.cpp ist ein kostenloser, MIT-lizenzierter C/C++-Port des Spracherkennungsmodells Whisper von OpenAI, entwickelt von Georgi Gerganov, der Audio vollständig lokal über CPU, Apple Metal, NVIDIA CUDA und weitere Backends transkribiert — ganz ohne Python.
💬 In einfachen Worten
Es wandelt gesprochene Sprache auf dem eigenen Computer oder Gerät in Text um, statt sie an eine Cloud-API zu senden — Sie laden ein kompiliertes Binary herunter oder bauen es selbst, geben eine Audiodatei oder einen Live-Mikrofonstream ein, und es liefert kostenlos ein Transkript zurück, mit denselben Modellen, die OpenAI trainiert hat.
📌Hinweis: Dieser Test konzentriert sich auf whisper.cpp als eigenständiges Werkzeug: Geschichte, Installation, echte Befehle, Lizenzierung und ehrliche Grenzen. Für einen direkten Benchmark-Vergleich mit faster-whisper auf Apple Silicon und NVIDIA-GPUs siehe den Whisper.cpp-vs-faster-whisper-Vergleich.
Geschichte: Wer hat whisper.cpp entwickelt und warum
OpenAI veröffentlichte sein Spracherkennungsmodell Whisper im September 2022 als Modell mit offenen Gewichten, trainiert auf einer großen Menge mehrsprachiger Audiodaten, verteilt als Python-Paket (openai-whisper), das von PyTorch und für gute Leistung von einer CUDA-fähigen GPU abhängt.
Georgi Gerganov portierte das Modell kurz danach, ebenfalls 2022, nach reinem C/C++, im Repository ggml-org/whisper.cpp. Gerganov ist auch der Schöpfer der ggml-Tensor-Bibliothek, die die Mathematik und Quantisierung von whisper.cpp trägt, und wurde später vor allem durch llama.cpp bekannt, den entsprechenden C/C++-Port für die lokale Ausführung großer Sprachmodelle — beide Projekte teilen dieselbe ggml-Grundlage und dasselbe Designziel: ein Modell, das normalerweise Python und eine GPU braucht, auf gewöhnlicher Hardware laufen zu lassen.
Die Motivation war Portabilität und Ressourceneffizienz, nicht nur Geschwindigkeit. Die ursprüngliche Python/PyTorch-Implementierung von Whisper läuft unkompliziert auf einer Workstation mit guter GPU, ist aber schwer auf einem Raspberry Pi, in einer iOS-App, auf einer WebAssembly-Seite oder auf einem eingebetteten Linux-Board ohne Python-Interpreter bereitzustellen. whisper.cpp entfernt die PyTorch- und Python-Abhängigkeit vollständig, kompiliert zu einem kleinen Binary und fügt Quantisierungsunterstützung hinzu, damit kleinere Modellvarianten in wenigen hundert Megabyte RAM passen.
Das Projekt ist längst über ein Ein-Personen-Nebenprojekt hinausgewachsen. Es hat inzwischen Hunderte Mitwirkende, wird für Debian paketiert und bietet offiziellen Support für Core ML (Apple Neural Engine), CUDA, Vulkan, OpenVINO und weitere Backends, die es in der ursprünglichen Version von 2022 noch nicht gab. Es bleibt eine Whisper-*Laufzeitumgebung* — es trainiert oder feintunt keine eigenen Modelle, und jede Transkription verwendet weiterhin dieselben von OpenAI veröffentlichten Gewichte für eine gegebene Modellgröße (tiny bis large-v3), umgewandelt in das GGML-Format des Projekts.
Wer hat whisper.cpp entwickelt?
Georgi Gerganov hat whisper.cpp entwickelt und 2022 erstmals als C/C++-Port von OpenAIs Whisper-Modell veröffentlicht. Gerganov schuf auch die ggml-Tensor-Bibliothek, auf der es läuft, und später llama.cpp, den entsprechenden Port für die lokale Ausführung großer Sprachmodelle.
Was whisper.cpp tatsächlich leistet
whisper.cpp nimmt einen Audio-Input entgegen — eine Datei (WAV, sowie weitere Formate über optionale FFmpeg-Dekodierung) oder einen Live-Mikrofonstream — und erzeugt ein Text-Transkript, optional mit Zeitstempeln pro Segment und Übersetzung ins Englische. Dazu lädt es ein Whisper-Modell (umgewandelt in das GGML-Gewichtsformat des Projekts) und führt die Inferenz über die ggml-Tensor-Bibliothek vollständig auf der lokalen Maschine aus.
- Batch-Transkription. Das Binary
whisper-cliauf eine Audiodatei richten und ein Transkript zurückbekommen, mit Optionen für die Ausgabe als reiner Text, SRT/VTT-Untertitel, JSON oder CSV. - Echtzeit-Streaming. Das Beispiel
whisper-streamerfasst Live-Mikrofonaudio und transkribiert es fortlaufend — nützlich für Sprachassistenten oder Live-Untertitelung. - Mehrsprachige Transkription und Übersetzung. Die zugrunde liegenden Whisper-Modelle wurden auf vielen Sprachen trainiert; whisper.cpp kann je nach übergebenen Flags in der Ausgangssprache transkribieren oder direkt ins Englische übersetzen.
- Hardwarebeschleunigte Inferenz. Auf Apple Silicon kann whisper.cpp Modelle ins Core-ML-Format exportieren, um die Apple Neural Engine zu nutzen; auf NVIDIA-Hardware verwendet es CUDA; auf anderen GPUs kann es Vulkan oder OpenVINO nutzen. Auf reinen CPU-Maschinen nutzt es AVX2 (x86) oder NEON (ARM) Vektorbefehle.
- Quantisierung. Modelle können quantisiert werden (zum Beispiel in 4-Bit- oder 5-Bit-GGML-Formate), um etwas Genauigkeit gegen deutlich geringeren Speicherverbrauch und schnellere Inferenz einzutauschen — dieselbe Technik, die llama.cpp für LLMs verwendet.
Whisper.cpp installieren und ausführen: Schritt für Schritt
Diese Anleitung baut whisper.cpp aus dem Quellcode und führt eine erste Transkription aus, mit den im README des Projekts dokumentierten Befehlen.
- 1Repository klonen.
Why it matters: Führen Sie `git clone https://github.com/ggml-org/whisper.cpp.git` gefolgt von `cd whisper.cpp` aus. Das lädt den vollständigen C/C++-Quellcodebaum inklusive CMake-Build-Dateien und Modell-Download-Skript herunter. - 2Ein Modell herunterladen.
Why it matters: Führen Sie `sh ./models/download-ggml-model.sh base.en` aus, um das englischsprachige base-Modell im GGML-Format herunterzuladen. Ersetzen Sie `base.en` je nach gewünschtem Verhältnis von Genauigkeit zu Geschwindigkeit durch `tiny`, `small`, `medium` oder `large-v3`, oder lassen Sie das Suffix `.en` für ein mehrsprachiges Modell weg. - 3Das Projekt bauen.
Why it matters: Führen Sie `cmake -B build` gefolgt von `cmake --build build -j --config Release` aus. Das kompiliert die CLI-Binaries (`whisper-cli`, `whisper-stream` und weitere) in das Verzeichnis `build/bin/`. Für diesen Schritt ist keine Python-Installation erforderlich. - 4Eine Beispieldatei transkribieren.
Why it matters: Führen Sie `./build/bin/whisper-cli -f samples/jfk.wav` mit der im Repository mitgelieferten Beispiel-Audiodatei aus. Das bestätigt, dass der Build durchgängig funktioniert, und gibt ein Transkript im Terminal aus. - 5Eigene Audiodateien transkribieren.
Why it matters: Ersetzen Sie den Beispielpfad durch Ihre eigene WAV-Datei: `./build/bin/whisper-cli -m models/ggml-base.en.bin -f your-audio.wav`. Fügen Sie `-osrt` hinzu, um zusätzlich eine `.srt`-Untertiteldatei zu schreiben, oder `-oj` für JSON-Ausgabe. - 6(Optional) GPU-Beschleunigung aktivieren.
Why it matters: Auf Apple Silicon wird Metal-Beschleunigung automatisch genutzt, sobald mit den Standard-CMake-Flags unter macOS gebaut wird. Auf einer NVIDIA-Maschine fügen Sie dem Schritt `cmake -B build` das Flag `-DGGML_CUDA=ON` hinzu (erfordert installiertes CUDA-Toolkit), um mit CUDA-Unterstützung zu bauen. - 7(Optional) Echtzeit-Transkription ausprobieren.
Why it matters: Bauen Sie das Streaming-Beispiel und führen Sie `./build/bin/whisper-stream -m models/ggml-base.en.bin` aus, um Live-Mikrofonaudio fortlaufend statt einer festen Datei zu transkribieren.
Echte Anwendungsbeispiele
Über die grundlegende Installationsanleitung oben hinaus sind dies gängige reale Aufrufe des Binarys whisper-cli.
- pywhispercpp bietet Python-Bindings für whisper.cpp für Teams, die die Metal-/CUDA-Beschleunigung nutzen, aber lieber aus Python-Code aufrufen wollen als das CLI-Binary pro Datei aufzurufen.
- whisper.cpp liefert außerdem ein kleines lokales HTTP-Server-Beispiel (
whisper-server) für Teams, die Audio über HTTP statt per CLI-Aufruf pro Datei senden wollen — nützlich, um whisper.cpp ohne Python-Abhängigkeit in einen bestehenden Dienst einzubinden.
# Audiodatei in reinen Text transkribieren (Standardausgabe)
./build/bin/whisper-cli -m models/ggml-base.en.bin -f interview.wav
# Transkribieren und SRT-Untertitel ausgeben, mit dem größeren, genaueren Modell
./build/bin/whisper-cli -m models/ggml-large-v3.bin -f lecture.wav -osrt
# Nicht-englische Sprache direkt ins Englische übersetzen
./build/bin/whisper-cli -m models/ggml-medium.bin -f french-audio.wav -tr
# Eine bestimmte GPU auswählen (Multi-GPU-Maschinen)
./build/bin/whisper-cli -m models/ggml-large-v3.bin -f audio.wav -g 0
# Echtzeit-Transkription vom Standardmikrofon
./build/bin/whisper-stream -m models/ggml-base.en.bin -t 8Lizenz und Kosten
whisper.cpp ist unter der MIT-Lizenz lizenziert — die Lizenzdatei im offiziellen Repository erlaubt kostenlose Nutzung, Veränderung und Weiterverbreitung, auch in Closed-Source- und kommerziellen Produkten, ohne Lizenzgebühr und ohne Namensnennungspflicht über den Erhalt des Lizenzhinweises hinaus.
Es gibt keine kostenpflichtige Stufe, kein Abonnement und keine Lizenzgebühr für whisper.cpp selbst. Die einzigen realen Kosten sind die Hardware, auf der Sie es betreiben (oder eine Cloud-VM, falls Sie es dort hosten), sowie, falls Sie ein Produkt darauf aufbauen, Ihre eigene Entwicklungszeit. Es gibt keine Nutzungsmessung, keinen API-Schlüssel und keine Anbieterbindung.
Die zugrunde liegenden Whisper-Modellgewichte sind separat von OpenAI ebenfalls unter MIT lizenziert, sodass sowohl die Laufzeitumgebung (whisper.cpp) als auch die geladenen Modellgewichte großzügig für die kommerzielle Nutzung lizenziert sind.
Ist whisper.cpp kommerziell kostenlos nutzbar?
Ja. whisper.cpp ist MIT-lizenziert, und die von OpenAI veröffentlichten Whisper-Modellgewichte, die es nutzt, sind ebenfalls MIT-lizenziert. Beide erlauben kommerzielle Nutzung, Veränderung und Weiterverbreitung ohne Gebühr.
Wofür whisper.cpp nicht geeignet ist
whisper.cpp ist eine Transkriptions-Laufzeitumgebung, kein vollständiges Produkt für Konversations-KI oder Sprechertrennung. Für folgende Situationen ist es das falsche Werkzeug:
- Sprechertrennung ("wer hat was gesagt"). whisper.cpp transkribiert, was gesagt wurde, trennt oder kennzeichnet aber nicht von sich aus verschiedene Sprecher in einer Aufnahme mit mehreren Personen. Sprechertrennung erfordert ein separates Modell oder eine Pipeline (zum Beispiel die Kombination des whisper.cpp-Transkripts mit einem Diarisierungswerkzeug), die darüber gelegt wird.
- Streaming-Latenz unter 100 Millisekunden im großen Maßstab. Das eingebaute Beispiel
whisper-streamfunktioniert gut für ein einzelnes Live-Mikrofon auf einer Maschine, aber whisper.cpp ist kein speziell gebauter, horizontal skalierter Echtzeit-Spracherkennungsdienst, wie er für viele gleichzeitige Nutzer bei einer dedizierten Echtzeit-Sprach-API konzipiert wäre. - Null Einrichtungsaufwand für technisch weniger versierte Nutzer. whisper.cpp ist ein Kommandozeilenwerkzeug, das die meisten Nutzer aus dem Quellcode bauen oder als kompiliertes Binary beziehen — es gibt keinen ausgereiften grafischen Installer oder App-Store-Eintrag für technisch weniger versierte Nutzer. Wer eine Point-and-Click-Transkriptions-App will, sollte stattdessen eine grafische Anwendung auf Basis von whisper.cpp oder einen gehosteten Transkriptionsdienst in Betracht ziehen.
- Letzte Prozentpunkte NVIDIA-GPU-Durchsatz in einer Python-first-Pipeline herausholen. Bei den größten Modellen auf NVIDIA-Hardware ergab PromptQuorums Benchmark, dass das CTranslate2-Backend von faster-whisper schneller und VRAM-schonender ist als der CUDA-Pfad von whisper.cpp — falls Ihre Bereitstellung bereits ein Python-Dienst auf einer NVIDIA-GPU ist, ist faster-whisper meist die bessere Wahl.
Alternativen zu whisper.cpp
faster-whisper
- Am besten geeignet für:
- Python-Pipelines auf NVIDIA-GPUs — CTranslate2-Backend, ~4x Durchsatz vs. Original-Whisper
- Lizenz:
- MIT
WhisperX
- Am besten geeignet für:
- Wenn Sie zusätzlich zu Whisper-Transkripten wortgenaue Zeitstempel und Sprechertrennung brauchen
- Lizenz:
- BSD-2-Clause
OpenAI Whisper API
- Am besten geeignet für:
- Teams, die eine verwaltete Cloud-API gegenüber Self-Hosting bevorzugen, gegen nutzungsabhängige Gebühren
- Lizenz:
- Proprietär (kostenpflichtige API)
Vosk
- Am besten geeignet für:
- Sehr ressourcenarme Offline-Geräte, bei denen ein kleiner Speicherbedarf wichtiger ist als Whisper-Genauigkeit
- Lizenz:
- Apache-2.0
Häufig gestellte Fragen
Was ist whisper.cpp?
whisper.cpp ist eine kostenlose, MIT-lizenzierte C/C++-Neuimplementierung des Spracherkennungsmodells Whisper von OpenAI, entwickelt von Georgi Gerganov, die Transkription lokal ohne Python-Laufzeitumgebung ausführt.
Ist whisper.cpp kostenlos?
Ja. whisper.cpp ist MIT-lizenziert, ohne kostenpflichtige Stufe, Abonnement oder Nutzungsgebühr. Die verwendeten Whisper-Modellgewichte sind ebenfalls von OpenAI unter MIT lizenziert.
Brauche ich eine GPU, um whisper.cpp auszuführen?
Nein. whisper.cpp läuft auf der CPU mit AVX2- (x86) oder NEON- (ARM) Optimierungen, und kleinere Modelle (tiny, base) laufen auf reiner CPU-Hardware, einschließlich eines Raspberry Pi, komfortabel in Echtzeit. Eine GPU (Apple Metal, NVIDIA CUDA oder Vulkan) beschleunigt größere Modelle wie large-v3, ist aber nicht erforderlich.
Unterstützt whisper.cpp Echtzeit-Transkription?
Ja, über das Beispiel whisper-stream, das Live-Mikrofonaudio erfasst und fortlaufend transkribiert. Die Latenz hängt von Modellgröße und Hardware ab — kleinere Modelle auf einer schnellen CPU oder GPU kommen der Echtzeit am nächsten.
Was ist der Unterschied zwischen whisper.cpp und faster-whisper?
whisper.cpp ist eine reine C/C++-Implementierung ohne Python-Abhängigkeit, gebaut für Portabilität über CPU, Apple Metal, CUDA und eingebettete Geräte. faster-whisper ist eine Python-Bibliothek auf Basis von CTranslate2, primär für NVIDIA-GPU-Durchsatz in Python-Pipelines optimiert. Siehe PromptQuorums ausführlichen Benchmark-Vergleich für plattformspezifische Zahlen.
Kann whisper.cpp auf einem Raspberry Pi laufen?
Ja. Die Modelle tiny und base laufen dank der ARM-NEON-Optimierungen von whisper.cpp auf der CPU eines Raspberry Pi 5 in Echtzeit, da das Projekt keine Python- oder CUDA-Abhängigkeit zur Installation benötigt.
Übersetzt whisper.cpp Audio ins Englische?
Ja. Mit dem Flag -tr (translate) an whisper-cli wird nicht-englische Sprache transkribiert und direkt in englischen Text übersetzt, unter Nutzung der in den mehrsprachigen Whisper-Modellen eingebauten Übersetzungsfähigkeit.
Wer pflegt whisper.cpp heute?
Das Projekt wird unter der ggml-org-Organisation auf GitHub gepflegt, gegründet vom ursprünglichen Schöpfer Georgi Gerganov, mit Beiträgen von Hunderten Community-Entwicklern. Es wird weiterhin aktiv veröffentlicht, mit v1.9.3 vom 20. August 2026.
Trennt whisper.cpp verschiedene Sprecher in einer Aufnahme?
Nicht von sich aus. whisper.cpp transkribiert Sprache zu Text, führt aber keine eigenständige Sprechertrennung durch. Für "wer hat was gesagt" kombinieren Sie es mit einem dedizierten Diarisierungswerkzeug oder verwenden Sie WhisperX, das Sprechertrennung auf Whisper-Transkripte aufsetzt.
Fazit
whisper.cpp erreicht genau das, was es sich vorgenommen hat: OpenAIs Whisper-Spracherkennungsmodell auf jedes Gerät zu bringen, das C/C++ kompilieren kann, ohne Python, CUDA oder eine schwere Laufzeitumgebung zu benötigen. Diese Portabilität — unverändert vom Raspberry Pi über einen Apple-Silicon-Mac bis zu einer Vulkan-fähigen GPU — hat für lokale, offline Transkription kein nahes kostenloses Äquivalent, und die MIT-Lizenz macht es sicher, kommerzielle Produkte darauf aufzubauen. Es ist kostenlos, gut gepflegt und verwendet dieselben Modellgewichte wie das ursprüngliche Whisper, sodass die Genauigkeit bei gegebener Modellgröße dem entspricht, was OpenAI veröffentlicht hat. Nicht die stärkste Wahl ist es für eine Python-first-Pipeline nur mit NVIDIA-GPU, die maximalen Durchsatz sucht — dort gewinnt das CTranslate2-Backend von faster-whisper, wie PromptQuorums direkter Vergleich dokumentiert. Für alle anderen — Entwickler, die eingebettete Hardware, Apple Silicon, plattformübergreifende Apps anvisieren, oder alle, die ein einzelnes eigenständiges Binary statt einer Python-Umgebung wollen — ist whisper.cpp ein gut verifizierter, kostenloser Ausgangspunkt.
Quellen
- whisper.cpp auf GitHub — offizielles Repository: README, Installationsanleitung, Lizenz und Versionshistorie.
- whisper.cpp-Releases — Versionshistorie, einschließlich v1.9.3 (20. August 2026).
- whisper.cpp-LIZENZ — MIT-Lizenztext.
- OpenAI-Whisper-Ankündigung — ursprüngliche Veröffentlichung des Whisper-Modells 2022.
