Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/faster-whisper im Test (2026): Lokale Spracherkennung mit CTranslate2-Beschleunigung
Voice, Speech & Multimodal

faster-whisper im Test (2026): Lokale Spracherkennung mit CTranslate2-Beschleunigung

·11 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

faster-whisper ist eine kostenlose, MIT-lizenzierte Python-Neuimplementierung des Spracherkennungsmodells Whisper von OpenAI, entwickelt von Guillaume Klein und unter SYSTRAN gepflegt, die mit der Inferenz-Engine CTranslate2 Transkription rund viermal schneller ausführt als die ursprüngliche Implementierung, bei geringerem Speicherverbrauch. Es unterstützt NVIDIA-GPUs (über CUDA, mit den Compute-Typen float16 oder int8) und CPUs (über int8-Quantisierung) und enthält einen eingebauten Silero-VAD-Filter (Sprachaktivitätserkennung), der Stille automatisch überspringt. Einen direkten Benchmark-Vergleich mit whisper.cpp auf echter Hardware finden Sie im Whisper.cpp-vs-faster-whisper-Vergleich von PromptQuorum.

faster-whisper ist eine Python-Neuimplementierung des Spracherkennungsmodells Whisper von OpenAI, aufgebaut auf der Inferenz-Engine CTranslate2, entwickelt von Guillaume Klein und heute unter SYSTRAN auf GitHub gepflegt. Es liefert auf derselben Hardware etwa die vierfache Transkriptionsgeschwindigkeit der ursprünglichen OpenAI-Implementierung, bei geringerem Speicherverbrauch durch int8-Quantisierung. Dieser Test behandelt die Geschichte des Projekts, echte Python-Anwendungsbeispiele, die Installation, die MIT-Lizenz und die Kosten (kostenlos) sowie die Grenzen des Tools — inklusive Verweis auf den direkten Benchmark-Vergleich von PromptQuorum mit whisper.cpp für alle, die sich zwischen beiden entscheiden müssen.

faster-whisper im Test (2026): Lokale Spracherkennung mit CTranslate2-Beschleunigung

Wichtigste Erkenntnisse

  • Entwickelt von Guillaume Klein im März 2023; heute unter SYSTRAN auf GitHub gepflegt.
  • MIT-Lizenz — kostenlose Nutzung, Veränderung und Weiterverbreitung, auch kommerziell.
  • Auf derselben Hardware rund viermal schnellere Transkription als das ursprüngliche openai-whisper-Paket.
  • Unterstützt NVIDIA-CUDA-GPUs (float16/int8) und CPU (int8) als Compute-Typen.
  • Eingebauter Silero-VAD-Filter (Sprachaktivitätserkennung), der stille Segmente automatisch überspringt.
  • Aktuelle stabile Version: v1.2.1, veröffentlicht am 31. Oktober 2025.

📍 In einem Satz

faster-whisper ist eine kostenlose, MIT-lizenzierte Python-Neuimplementierung des Spracherkennungsmodells Whisper von OpenAI, entwickelt von Guillaume Klein und unter SYSTRAN gepflegt, die mit der Inferenz-Engine CTranslate2 rund viermal schneller transkribiert als die ursprüngliche Implementierung, bei geringerem Speicherverbrauch.

💬 In einfachen Worten

Es ist eine Python-Bibliothek, die Sie per pip install einrichten, um Audio auf dem eigenen Rechner in Text umzuwandeln — mit denselben Whisper-Modellen, die OpenAI trainiert hat, aber über eine schnellere, speicherschonendere Engine ausgeführt — ohne Cloud-API-Aufruf, und mit automatischer Stille-Erkennung bereits eingebaut.

📌Hinweis: Dieser Test konzentriert sich auf faster-whisper als eigenständiges Werkzeug: Geschichte, Installation, echten Python-Code, Lizenzierung und ehrliche Grenzen. Für einen direkten Benchmark-Vergleich mit whisper.cpp auf Apple Silicon und NVIDIA-GPUs siehe den Whisper.cpp-vs-faster-whisper-Vergleich.

Geschichte: Wer hat faster-whisper entwickelt und warum

OpenAI veröffentlichte sein Spracherkennungsmodell Whisper im September 2022 als Modell mit offenen Gewichten, verteilt als Python-Paket (openai-whisper) auf Basis von PyTorch, das unkompliziert zu betreiben, aber nicht von Haus aus auf Inferenzgeschwindigkeit oder Speichereffizienz optimiert ist.

Guillaume Klein entwickelte faster-whisper im März 2023 und veröffentlichte es im Repository SYSTRAN/faster-whisper. Klein baute faster-whisper auf CTranslate2 auf, einer C++- und Python-Inferenz-Engine für Transformer-Modelle, die ursprünglich im Rahmen des maschinellen Übersetzungsprojekts OpenNMT entwickelt wurde und in die SYSTRAN — ein Unternehmen mit langer Geschichte in der maschinellen Übersetzung — seit Langem investiert. CTranslate2 bietet eigene CUDA-Kernel, INT8/FP16-Quantisierung und fusionierte Operationen, die generische PyTorch-Inferenz standardmäßig nicht anwendet.

Die Motivation war Inferenzeffizienz, nicht ein neues Modell. faster-whisper trainiert oder verändert die Whisper-Modellarchitektur nicht — es lädt dieselben von OpenAI trainierten Gewichte, umgewandelt in das CTranslate2-Modellformat, und führt sie über einen deutlich stärker optimierten Ausführungspfad aus. Das vom Projekt berichtete Ergebnis ist eine auf derselben Hardware bis zu rund viermal schnellere Transkription als die ursprüngliche openai-whisper-Implementierung, bei geringerem Speicherverbrauch durch int8-Quantisierung und ohne messbaren Genauigkeitsverlust bei vergleichbaren Einstellungen.

Das Projekt ist zum am weitesten verbreiteten CTranslate2-basierten Whisper-Wrapper herangewachsen. Es erhielt einen eingebauten Silero-VAD-Filter zur automatischen Erkennung und zum Überspringen stiller Audiosegmente, wortgenaue Zeitstempel und Unterstützung für Batch-Inferenz, blieb dabei aber auf das Ziel fokussiert, eine schnelle, leicht integrierbare Bibliothek zu sein statt eine vollständige Anwendung. Es wird weiterhin unter der SYSTRAN-Organisation auf GitHub gepflegt, mit Releases, die neue CTranslate2-Versionen und Whisper-Modell-Updates nachvollziehen.

Wer hat faster-whisper entwickelt?

Guillaume Klein entwickelte faster-whisper im März 2023 auf Basis der Inferenz-Engine CTranslate2. Das Projekt wird heute unter SYSTRAN auf GitHub gepflegt.

Was faster-whisper tatsächlich leistet

faster-whisper nimmt eine Audiodatei als Eingabe entgegen und erzeugt über die Python-Klasse WhisperModel ein Text-Transkript, wobei eine per CTranslate2 umgewandelte Version eines Whisper-Modells genutzt wird, um die Inferenz deutlich schneller auszuführen als die ursprüngliche PyTorch-basierte Implementierung.

  • Schnelle Batch-Transkription. Ein WhisperModel einmal laden und .transcribe() auf eine Audiodatei aufrufen, um einen Generator mit zeitgestempelten Segmenten und Informationen zur Spracherkennung zurückzubekommen.
  • Eingebaute Sprachaktivitätserkennung (VAD). Mit vad_filter=True wird vor der Transkription ein Silero-VAD-Modell ausgeführt, das stille Abschnitte automatisch entfernt und so unnötige Rechenlast sowie halluzinierten Text bei Stille reduziert.
  • Mehrere Compute-Typen. Wahl zwischen float16 oder int8_float16 auf der GPU, oder int8 auf der CPU, wobei etwas Präzision gegen geringeren Speicherverbrauch und höhere Geschwindigkeit eingetauscht wird.
  • Wortgenaue Zeitstempel. Mit word_timestamps=True werden zusätzlich zu segmentweisen Zeitstempeln pro-Wort-Zeitinformationen zurückgegeben.
  • Batch-Inferenz. Die Klasse BatchedInferencePipeline verarbeitet mehrere Audiosegmente parallel in Batches für höheren Durchsatz bei längeren Dateien.
  • Mehrsprachige Transkription und Übersetzung. Wie die zugrunde liegenden Whisper-Modelle kann faster-whisper in der Ausgangssprache transkribieren oder über den Parameter task="translate" direkt ins Englische übersetzen.

faster-whisper installieren und ausführen: Schritt für Schritt

Diese Anleitung installiert faster-whisper per pip und führt eine erste Transkription aus, mit der im README des Projekts dokumentierten Syntax.

  1. 1
    faster-whisper installieren.
    Why it matters: Führen Sie `pip install faster-whisper` in einer Python-Umgebung aus (Python 3.9+ wird empfohlen). Das installiert die Bibliothek zusammen mit ihrer CTranslate2-Abhängigkeit; für die CPU-Nutzung ist keine separate CUDA-Toolkit-Installation nötig.
  2. 2
    (Nur GPU) CUDA und cuDNN prüfen.
    Why it matters: Für GPU-Beschleunigung benötigen Sie einen funktionierenden NVIDIA-Treiber und eine CUDA-Einrichtung. faster-whisper stützt sich auf die GPU-Unterstützung von CTranslate2 — schlägt `device="cuda"` fehl, prüfen Sie zuerst, ob `nvidia-smi` Ihre GPU korrekt anzeigt, bevor Sie auf der Python-Seite weitersuchen.
  3. 3
    Ein Modell laden.
    Why it matters: Führen Sie in Python `from faster_whisper import WhisperModel` aus, dann `model = WhisperModel("large-v3", device="cuda", compute_type="float16")`. Ersetzen Sie `"large-v3"` durch `"tiny"`, `"base"`, `"small"` oder `"medium"` für ein kleineres, schnelleres Modell, oder verwenden Sie `device="cpu"` mit `compute_type="int8"`, falls Sie keine GPU haben.
  4. 4
    Eine Audiodatei transkribieren.
    Why it matters: Führen Sie `segments, info = model.transcribe("audio.mp3", beam_size=5)` aus. Das gibt einen Generator von Segmenten zurück (keine Liste) — Sie müssen darüber iterieren, damit die Transkription tatsächlich ausgeführt wird.
  5. 5
    Das Transkript ausgeben.
    Why it matters: Iterieren Sie über die Segmente: `for segment in segments: print("[%.2fs -> %.2fs] %s" % (segment.start, segment.end, segment.text))`. Jedes Segment enthält einen Start- und Endzeitpunkt sowie den transkribierten Text für diesen Abschnitt.
  6. 6
    (Optional) VAD-Filterung aktivieren.
    Why it matters: Übergeben Sie `vad_filter=True` an `.transcribe()`, um stille Abschnitte von Audio automatisch mit dem eingebauten Silero-VAD-Modell zu überspringen — das reduziert unnötige Rechenlast bei langen Aufnahmen mit Pausen.
  7. 7
    (Optional) Wortgenaue Zeitstempel erhalten.
    Why it matters: Übergeben Sie `word_timestamps=True` an `.transcribe()`, um zusätzlich zur segmentweisen Zeitangabe pro-Wort-Zeiten zu erhalten — nützlich für Untertitel oder das Hervorheben von Wörtern beim Sprechen.

Echte Anwendungsbeispiele

Über die grundlegende Installationsanleitung oben hinaus sind dies gängige reale Nutzungsmuster aus der eigenen Dokumentation des Projekts.

  • BatchedInferencePipeline umschließt ein WhisperModel, um mehrere Audio-Abschnitte parallel zu verarbeiten und den Durchsatz bei langen Dateien zu verbessern: from faster_whisper import BatchedInferencePipeline; batched_model = BatchedInferencePipeline(model=model).
  • Kompatibilität mit distil-large-v3. faster-whisper unterstützt destillierte Whisper-Varianten wie distil-large-v3 nativ — laden Sie es genauso wie einen Standard-Modellnamen, um etwas Genauigkeit gegen rund 6x schnellere Inferenz einzutauschen.
python
from faster_whisper import WhisperModel

# GPU mit float16 (am schnellsten, benötigt CUDA + cuDNN)
model = WhisperModel("large-v3", device="cuda", compute_type="float16")

# CPU mit int8 (keine GPU nötig, langsamer)
# model = WhisperModel("base", device="cpu", compute_type="int8")

segments, info = model.transcribe("audio.mp3", beam_size=5, vad_filter=True)

print(f"Detected language '{info.language}' with probability {info.language_probability:.2f}")

for segment in segments:
    print("[%.2fs -> %.2fs] %s" % (segment.start, segment.end, segment.text))

# Nicht-englische Sprache direkt ins Englische übersetzen
segments, info = model.transcribe("french-audio.mp3", task="translate")

# Wortgenaue Zeitstempel für Untertitel
segments, info = model.transcribe("audio.mp3", word_timestamps=True)
for segment in segments:
    for word in segment.words:
        print("[%.2fs -> %.2fs] %s" % (word.start, word.end, word.word))

Lizenz und Kosten

faster-whisper ist unter der MIT-Lizenz lizenziert — die Lizenzdatei im offiziellen Repository erlaubt kostenlose Nutzung, Veränderung und Weiterverbreitung, auch in Closed-Source- und kommerziellen Produkten, ohne Lizenzgebühr und ohne Namensnennungspflicht über den Erhalt des Lizenzhinweises hinaus.

Es gibt keine kostenpflichtige Stufe, kein Abonnement und keine Lizenzgebühr für faster-whisper selbst. Die einzigen realen Kosten sind die Hardware, auf der Sie es betreiben (oder eine gemietete Cloud-GPU-Instanz), sowie, falls Sie ein Produkt darauf aufbauen, Ihre eigene Entwicklungszeit. Es gibt keine Nutzungsmessung, keinen API-Schlüssel und keine Anbieterbindung.

CTranslate2, die Inferenz-Engine, von der faster-whisper abhängt, ist ebenfalls MIT-lizenziert, und die zugrunde liegenden Whisper-Modellgewichte sind separat von OpenAI ebenfalls unter MIT lizenziert — der gesamte Stack (Laufzeitumgebung, Inferenz-Engine und Modellgewichte) ist somit großzügig für die kommerzielle Nutzung lizenziert.

Ist faster-whisper kommerziell kostenlos nutzbar?

Ja. faster-whisper ist MIT-lizenziert, seine CTranslate2-Abhängigkeit ist MIT-lizenziert, und die verwendeten Whisper-Modellgewichte sind ebenfalls von OpenAI unter MIT lizenziert. Alle drei erlauben kommerzielle Nutzung, Veränderung und Weiterverbreitung ohne Gebühr.

Wofür faster-whisper nicht geeignet ist

faster-whisper ist eine schnelle Python-Transkriptionsbibliothek, kein vollständiges Produkt für Konversations-KI und kein Python-freies Bereitstellungswerkzeug. Für folgende Situationen ist es das falsche Werkzeug:

  • Python-freie oder plattformübergreifende Binary-Bereitstellung. faster-whisper ist eine Python-Bibliothek mit einer nativen CTranslate2-Abhängigkeit — es ist nicht als einzelnes, abhängigkeitsfreies Binary konzipiert, wie es whisper.cpp ist. Wenn Sie einen Raspberry Pi, eine iOS-App oder eine WebAssembly-Seite ohne Python-Laufzeitumgebung ansprechen müssen, ist whisper.cpp die bessere Wahl.
  • Apple-Silicon-GPU-Beschleunigung. Das CTranslate2-Backend von faster-whisper unterstützt CPU und NVIDIA CUDA, hat aber keinen Apple-Metal-GPU-Beschleunigungspfad — auf einem Mac fällt faster-whisper auf reine CPU-Inferenz zurück. PromptQuorums Benchmark fand whisper.cpp mit Metal-Beschleunigung deutlich schneller als faster-whisper nur auf CPU auf Apple Silicon.
  • Sprechertrennung ("wer hat was gesagt"). faster-whisper transkribiert, was gesagt wurde, trennt oder kennzeichnet aber nicht von sich aus verschiedene Sprecher in einer Aufnahme mit mehreren Personen. Für Sprechertrennung kombinieren Sie die Transkripte mit einem dedizierten Werkzeug oder verwenden Sie WhisperX, das Sprechertrennung auf Whisper-Transkripte aufsetzt.
  • Null Einrichtungsaufwand für technisch weniger versierte Nutzer. faster-whisper ist eine Python-Bibliothek für Entwickler, die Pipelines bauen, keine Endanwendung mit grafischer Oberfläche. Wer eine Point-and-Click-Transkriptions-App will, sollte stattdessen eine Anwendung auf Basis von faster-whisper oder whisper.cpp oder einen gehosteten Transkriptionsdienst in Betracht ziehen.

Alternativen zu faster-whisper

whisper.cpp

Am besten geeignet für:
Python-freie, plattformübergreifende Bereitstellung — Apple Silicon, eingebettete Geräte, Mobilgeräte
Lizenz:
MIT

WhisperX

Am besten geeignet für:
Wenn Sie wortgenaue Zeitstempel und Sprechertrennung auf Basis von Whisper/faster-whisper brauchen
Lizenz:
BSD-2-Clause

insanely-fast-whisper

Am besten geeignet für:
Maximaler GPU-Durchsatz über Hugging Face Transformers und Flash Attention, auf sehr aktuellen GPUs
Lizenz:
Apache-2.0

OpenAI Whisper API

Am besten geeignet für:
Teams, die eine verwaltete Cloud-API gegenüber Self-Hosting bevorzugen, gegen nutzungsabhängige Gebühren
Lizenz:
Proprietär (kostenpflichtige API)

Häufig gestellte Fragen

Was ist faster-whisper?

faster-whisper ist eine kostenlose, MIT-lizenzierte Python-Neuimplementierung des Spracherkennungsmodells Whisper von OpenAI, entwickelt von Guillaume Klein und unter SYSTRAN gepflegt, die mit der Inferenz-Engine CTranslate2 deutlich schneller transkribiert als die ursprüngliche Implementierung.

Ist faster-whisper kostenlos?

Ja. faster-whisper ist MIT-lizenziert, ohne kostenpflichtige Stufe, Abonnement oder Nutzungsgebühr. Auch die CTranslate2-Abhängigkeit und die zugrunde liegenden Whisper-Modellgewichte sind MIT-lizenziert.

Brauche ich eine GPU, um faster-whisper auszuführen?

Nein. faster-whisper unterstützt CPU-Inferenz über int8-Quantisierung, läuft aber am schnellsten auf einer NVIDIA-GPU mit CUDA unter Verwendung der Compute-Typen float16 oder int8_float16. Es hat keinen Apple-Metal-GPU-Beschleunigungspfad, läuft auf einem Mac also nur auf der CPU.

Wie viel schneller ist faster-whisper als das ursprüngliche OpenAI Whisper?

Das Projekt berichtet von bis zu rund viermal schnellerer Transkription als das ursprüngliche openai-whisper-Paket auf derselben Hardware, bei geringerem Speicherverbrauch durch int8-Quantisierung und ohne nennenswerten Genauigkeitsverlust bei vergleichbaren Einstellungen.

Was ist der Unterschied zwischen faster-whisper und whisper.cpp?

faster-whisper ist eine Python-Bibliothek auf Basis von CTranslate2, primär für NVIDIA-GPU-Durchsatz in Python-Pipelines optimiert. whisper.cpp ist eine reine C/C++-Implementierung ohne Python-Abhängigkeit, gebaut für Portabilität über CPU, Apple Metal, CUDA und eingebettete Geräte. Siehe PromptQuorums ausführlichen Benchmark-Vergleich für plattformspezifische Zahlen.

Unterstützt faster-whisper Sprachaktivitätserkennung?

Ja. Mit vad_filter=True an .transcribe() wird ein eingebautes Silero-VAD-Modell ausgeführt, das stille Segmente von Audio vor der Transkription automatisch erkennt und überspringt.

Kann faster-whisper wortgenaue Zeitstempel liefern?

Ja. Mit word_timestamps=True an .transcribe() werden zusätzlich zu den standardmäßigen segmentweisen Zeitstempeln Start- und Endzeiten pro Wort zurückgegeben — nützlich für die Untertitelerstellung.

Übersetzt faster-whisper Audio ins Englische?

Ja. Mit task="translate" an .transcribe() wird nicht-englische Sprache transkribiert und direkt in englischen Text übersetzt, unter Nutzung der eingebauten Übersetzungsfähigkeit der mehrsprachigen Whisper-Modelle.

Wer pflegt faster-whisper heute?

Das Projekt wurde im März 2023 von Guillaume Klein entwickelt und wird heute unter der SYSTRAN-Organisation auf GitHub gepflegt. Die aktuelle stabile Version ist v1.2.1, veröffentlicht am 31. Oktober 2025.

Fazit

faster-whisper erreicht sein Kernziel: OpenAIs Whisper-Modell für Python-Entwickler deutlich schneller und speicherschonender zu machen, ohne zu verändern, was das Modell liefert. Das CTranslate2-Backend liefert rund die vierfache Geschwindigkeit der ursprünglichen Implementierung, der eingebaute Silero-VAD-Filter ist eine echte praktische Erleichterung für reale Audiodateien mit Stille, und die MIT-Lizenz macht es sicher, kommerzielle Produkte darauf aufzubauen. Es ist kostenlos, gut gepflegt und liefert bei gegebener Modellgröße dieselbe Transkriptionsqualität wie das ursprüngliche Whisper. Nicht die stärkste Wahl ist es bei Python-freier oder Apple-Silicon-GPU-beschleunigter Bereitstellung — dort gewinnen die Metal-Unterstützung und das abhängigkeitsfreie Binary von whisper.cpp, wie PromptQuorums direkter Vergleich dokumentiert. Für alle, die eine Python-Pipeline für Spracherkennung auf einer NVIDIA-GPU oder CPU bauen und Geschwindigkeit wollen, ohne das Python-Ökosystem zu verlassen, ist faster-whisper ein gut verifizierter, kostenloser Ausgangspunkt.

Quellen

← Zurück zu Lokale LLMs Pro