Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Lokale Sprach- und Audio-Werkzeuge im Vergleich (2026): Text-zu-Sprache, Sprache-zu-Text und Sprachagenten
Voice, Speech & Multimodal

Lokale Sprach- und Audio-Werkzeuge im Vergleich (2026): Text-zu-Sprache, Sprache-zu-Text und Sprachagenten

·9 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Die 17 lokalen Sprach-Werkzeuge im PromptQuorum-Verzeichnis teilen sich in drei Aufgaben, die getrennt verglichen werden sollten: Text-zu-Sprache (8 Werkzeuge), Sprache-zu-Text (7) und Echtzeit-Sprachagenten (4). Bei Text-zu-Sprache wird Stimmklonen in der offiziellen Dokumentation von Coqui TTS, XTTS-v2, Izwi und Willow Inference Server genannt; bei Sprache-zu-Text dokumentieren whisper.cpp und Willow Inference Server Echtzeit-Transkription; Dograh, Jarvis, Parlor und Voxa sind die Sprachagenten. Nutzen Sie die Vergleichstabelle unten und lesen Sie den Test des jeweiligen Werkzeugs, bevor Sie es installieren.

Lokale Sprach-Werkzeuge erledigen drei verschiedene Aufgaben — Text in Sprache umwandeln, Sprache in Text umwandeln und ein gesprochenes Gespräch mit einer KI führen —, und keine einzelne Funktionsliste vergleicht sie fair. Dieser Leitfaden vergleicht 17 kostenlose und Freemium-Werkzeuge, die auf Ihrer eigenen Hardware laufen, Aufgabe für Aufgabe. Die Vergleichstabelle wird aus denselben Daten erzeugt wie der jeweilige PromptQuorum-Test des Werkzeugs, sodass sich Tabelle und Tests nicht widersprechen können.

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.

Wichtigste Erkenntnisse

  • 17 Werkzeuge, drei Aufgaben: Text-zu-Sprache (8), Sprache-zu-Text (7), Echtzeit-Sprachagenten (4). Izwi und Willow Inference Server leisten sowohl Text-zu-Sprache als auch Sprache-zu-Text und erscheinen daher in beiden Tabellen.
  • Die Tabelle wird aus dem Datensatz jedes Werkzeugs erzeugt und mit dessen offizieller README oder Website abgeglichen; ein Strich bedeutet „in der Dokumentation nicht angegeben“, niemals „nein“.
  • Lizenzen unterscheiden sich auf relevante Weise: Piper und OpenAI Edge TTS stehen zum Beispiel unter GPL-3.0, Coqui TTS unter MPL-2.0, XTTS-v2 nutzt die Coqui Public Model License, und Bark, StyleTTS 2, whisper.cpp und faster-whisper stehen unter MIT.
  • Jeder Werkzeugname in der Tabelle verlinkt auf den eigenen PromptQuorum-Test, in dem Installationsschritte und Grenzen behandelt werden.

📍 In einem Satz

Lokale Sprach-Werkzeuge sind drei verschiedene Aufgaben — Text-zu-Sprache, Sprache-zu-Text und Echtzeit-Sprachagenten —, daher werden die 17 Werkzeuge im PromptQuorum-Verzeichnis innerhalb jeder Aufgabe verglichen, mit einer Tabelle, die aus denselben Werkzeugdaten wie der jeweilige Test erzeugt wird.

💬 In einfachen Worten

Manche Werkzeuge lesen Text vor, manche schreiben mit, was Sie sagen, und manche führen ein gesprochenes Gespräch mit einer KI. Einen Vorleser und ein Transkriptionswerkzeug beim „Stimmklonen“ zu vergleichen ergibt keinen Sinn, deshalb vergleicht dieser Leitfaden Gleiches mit Gleichem.

So haben wir verglichen

Die Fakten jedes Werkzeugs — Preis, Lizenz, Plattformen, Hardware-Anforderungen und aufgabenspezifische Merkmale — werden einmalig im Verzeichniseintrag des Werkzeugs gespeichert. Die Vergleichstabelle unten wird aus diesen Einträgen erzeugt, und der Test des Werkzeugs greift auf denselben Eintrag zurück, sodass beide keine unterschiedlichen Werte nennen können.

Aufgabenspezifische Merkmale (zum Beispiel Stimmklonen oder Echtzeit-Transkription) wurden der offiziellen README oder Website des jeweiligen Projekts entnommen und am genauen Wortlaut dort geprüft. Wo die Dokumentation schweigt, zeigt die Tabelle einen Strich statt zu raten; wo eine Angabe eingeschränkt ist (experimentell, nur im bezahlten Tarif oder abhängig von einer GPU), wird das Merkmal aus der Tabelle weggelassen und stattdessen im Test des Werkzeugs behandelt.

Der Vergleich listet Werkzeuge auf, die auf Ihrer eigenen Hardware laufen. Er erstellt keine Rangliste: Welches das richtige ist, hängt von Ihrer Anforderung ab, und die Abschnitte unten zeigen, wo die tatsächlichen Unterschiede liegen.

Vergleichstabelle

Wählen Sie unten eine Aufgabe und lesen Sie dann quer durch eine Zeile. Klicken Sie auf einen Werkzeugnamen, um den vollständigen PromptQuorum-Test zu öffnen.

WerkzeugPreisLizenzPlattformenAusführungHardwareVersionSprachenStimmklonenStreaming-AusgabeNur mit CPU nutzbarLokaler API-ServerTestProduktlink · offengelegt
BarkKostenlosMITmacOS, Windows, LinuxLokalCPU genügt13NeinTest lesenBark
Coqui TTSKostenlosMPL-2.0macOS, Windows, LinuxLokalCPU genügtv0.27.5JaJaJaTest lesenCoqui TTS
IzwiKostenlosMITmacOS, Windows, LinuxLokalJe nach Modell unterschiedlichv0.1.0-beta-17JaJaJaTest lesenIzwi
openai-edge-ttsKostenlosGPL-3.0macOS, Windows, LinuxHybridCPU genügtJaJaTest lesenopenai-edge-tts
Piper TTSKostenlosGPL-3.0macOS, Windows, LinuxLokalCPU genügtJaTest lesenPiper TTS
StyleTTS 2KostenlosMITmacOS, Windows, LinuxLokalCPU genügtTest lesenStyleTTS 2
Willow Inference ServerKostenlosApache-2.0Linux, WindowsLokalCPU genügtJaJaJaTest lesenWillow Inference Server
XTTS v2KostenlosCPMLmacOS, Windows, LinuxLokal17JaTest lesenXTTS v2

„—“ bedeutet, dass die eigene Dokumentation des Projekts es nicht angibt, nicht dass die Funktion fehlt. Die Werte stammen aus der offiziellen README oder Website des jeweiligen Projekts und werden erneut geprüft, wenn der Test eines Werkzeugs aktualisiert wird.

Text-zu-Sprache: Was sich unterscheidet

  • Lizenz. Bark und StyleTTS 2 stehen unter MIT. Coqui TTS steht unter MPL-2.0. XTTS-v2 nutzt die Coqui Public Model License (CPML), eine eigene Lizenz mit eigenen Bedingungen statt einer Standard-Open-Source-Lizenz — lesen Sie sie vor jeder kommerziellen Nutzung. Piper und OpenAI Edge TTS stehen unter GPL-3.0, die Bedingungen für die Weitergabe veränderter Versionen stellt. Prüfen Sie die Lizenz, bevor Sie ein Produkt auf einem davon aufbauen — siehe Piper TTS und XTTS v2.
  • Stimmklonen. Coqui TTS (Test), XTTS-v2 (Test), Izwi (Test) und Willow Inference Server (Test) dokumentieren Stimmklonen oder eigene Stimmen. Bark gibt an, dass es kein eigenes Stimmklonen unterstützt.
  • Lokaler API-Server. Coqui TTS, Izwi, OpenAI Edge TTS, Piper und Willow Inference Server dokumentieren eine Serverkomponente, sodass andere Apps sie über HTTP aufrufen können; OpenAI Edge TTS ist darauf ausgelegt.
  • Sprachen. Bark dokumentiert 13 Sprachen und XTTS-v2 dokumentiert 17. Die anderen Werkzeuge geben keine vergleichbare Anzahl an, daher zeigt die Tabelle einen Strich statt einer Zahl.

Sprache-zu-Text: Was sich unterscheidet

  • Echtzeit-Transkription. whisper.cpp dokumentiert ein Echtzeit-Streaming-Beispiel, und Izwi und Willow Inference Server dokumentieren Echtzeit-Nutzung. faster-whisper ist eine Transkriptionsbibliothek; ihre eigene README dokumentiert keinen Echtzeitmodus.
  • Sprecherkennzeichnung. Izwi und FunClip dokumentieren Sprecherkennzeichnung. Meetily bietet Sprechertrennung (Diarisierung) nur im bezahlten Pro-Tarif. Die Sprecherwechsel-Markierung von whisper.cpp ist experimentell und wird im zugehörigen Test statt in der Tabelle behandelt.
  • Preis und Plattform. MacWhisper ist eine proprietäre macOS-App mit kostenlosem Tarif und kostenpflichtigem Upgrade; die meisten anderen Werkzeuge hier sind kostenlos und Open Source. Meetilys Community Edition ist kostenlos und steht unter MIT, mit einem bezahlten Pro-Tarif.
  • Lokaler API-Server. whisper.cpp liefert einen Server mit, und Izwi und Willow Inference Server dokumentieren HTTP-APIs.

Sprachagenten: Was sich unterscheidet

  • Vollständig lokal oder optionale Cloud. Jarvis dokumentiert einen lokalen Stack aus Spracheingabe, LLM und Sprachausgabe; Parlor dokumentiert eine lokale Pipeline mit optionaler Cloud-Recherchefunktion. Voxa kann einen lokalen Sprachanbieter oder Cloud-Anbieter nutzen und ist daher nur dann vollständig lokal, wenn Sie den lokalen wählen.
  • Unterbrechung (Barge-in). Jarvis, Parlor und Voxa dokumentieren, dass Sie den Agenten unterbrechen können, während er spricht.
  • Eigenes LLM und Telefonanrufe. Dograh dokumentiert eine Auswahl an LLMs und Telefonie-Integrationen; Voxa dokumentiert die Anbindung eines eigenen Modells über einen lokalen Daemon.

Was dieser Vergleich nicht aussagen kann

  • Er vergleicht dokumentierte Fähigkeiten, nicht die Qualität. Er sagt nichts darüber, wie natürlich eine Stimme klingt oder wie genau ein Transkript ist — dafür brauchen Sie Ihr eigenes Audiomaterial und Ihre eigene Hardware.
  • Er enthält keine Geschwindigkeits-Benchmarks: PromptQuorum hat diese für die Werkzeuge nicht gemessen.
  • Striche sind Lücken in der Dokumentation der Projekte, keine negativen Befunde. Manche Werkzeuge unterstützen möglicherweise eine Funktion, die ihre README nicht erwähnt.
  • Werkzeuge ändern sich schnell. Der Test jedes Werkzeugs nennt die Version, gegen die geprüft wurde, und dieser Leitfaden wird aktualisiert, wenn ein Test aktualisiert wird.

Häufig gestellte Fragen

Warum werden Text-zu-Sprache, Sprache-zu-Text und Sprachagenten getrennt verglichen?

Sie erfüllen verschiedene Aufgaben, daher ergeben die meisten Merkmale nur innerhalb einer Aufgabe Sinn — Stimmklonen betrifft Text-zu-Sprache, Sprecherkennzeichnung die Transkription, Unterbrechung die Sprachagenten. Ein gemeinsamer Vergleich in einer Tabelle ließe die meisten Zellen leer oder bedeutungslos.

Was bedeutet ein Strich in der Vergleichstabelle?

Er bedeutet, dass die eigene Dokumentation des Projekts dieses Merkmal nicht angibt. Er bedeutet nicht, dass die Funktion fehlt; prüfen Sie den Test des Werkzeugs oder dessen Repository.

Sind diese Werkzeuge wirklich lokal?

Sie sind dafür ausgelegt, auf Ihrer eigenen Hardware zu laufen, aber einige bieten optionale Cloud-Funktionen — etwa Parlors optionale Cloud-Recherche oder Voxas Cloud-Sprachanbieter —, und einige benötigen beim ersten Start Internet, um Modelle herunterzuladen. Der Test jedes Werkzeugs behandelt das.

Hat eines dieser Werkzeuge einen Affiliate-Link?

Nein. PromptQuorum hat zum Zeitpunkt der Erstellung keine Affiliate-Beziehung zu einem Werkzeug in diesem Vergleich, und kein Link hier bringt eine Provision.

Wie oft wird dieser Vergleich aktualisiert?

Er wird zweimal im Jahr aktualisiert sowie immer dann, wenn der Test eines der aufgeführten Werkzeuge aktualisiert wird, weil die Tabelle aus denselben Daten wie diese Tests erzeugt wird.

Quellen

← Zurück zu Lokale LLMs Pro