Wichtigste Erkenntnisse
- 17 Werkzeuge, drei Aufgaben: Text-zu-Sprache (8), Sprache-zu-Text (7), Echtzeit-Sprachagenten (4). Izwi und Willow Inference Server leisten sowohl Text-zu-Sprache als auch Sprache-zu-Text und erscheinen daher in beiden Tabellen.
- Die Tabelle wird aus dem Datensatz jedes Werkzeugs erzeugt und mit dessen offizieller README oder Website abgeglichen; ein Strich bedeutet „in der Dokumentation nicht angegeben“, niemals „nein“.
- Lizenzen unterscheiden sich auf relevante Weise: Piper und OpenAI Edge TTS stehen zum Beispiel unter GPL-3.0, Coqui TTS unter MPL-2.0, XTTS-v2 nutzt die Coqui Public Model License, und Bark, StyleTTS 2, whisper.cpp und faster-whisper stehen unter MIT.
- Jeder Werkzeugname in der Tabelle verlinkt auf den eigenen PromptQuorum-Test, in dem Installationsschritte und Grenzen behandelt werden.
📍 In einem Satz
Lokale Sprach-Werkzeuge sind drei verschiedene Aufgaben — Text-zu-Sprache, Sprache-zu-Text und Echtzeit-Sprachagenten —, daher werden die 17 Werkzeuge im PromptQuorum-Verzeichnis innerhalb jeder Aufgabe verglichen, mit einer Tabelle, die aus denselben Werkzeugdaten wie der jeweilige Test erzeugt wird.
💬 In einfachen Worten
Manche Werkzeuge lesen Text vor, manche schreiben mit, was Sie sagen, und manche führen ein gesprochenes Gespräch mit einer KI. Einen Vorleser und ein Transkriptionswerkzeug beim „Stimmklonen“ zu vergleichen ergibt keinen Sinn, deshalb vergleicht dieser Leitfaden Gleiches mit Gleichem.
So haben wir verglichen
Die Fakten jedes Werkzeugs — Preis, Lizenz, Plattformen, Hardware-Anforderungen und aufgabenspezifische Merkmale — werden einmalig im Verzeichniseintrag des Werkzeugs gespeichert. Die Vergleichstabelle unten wird aus diesen Einträgen erzeugt, und der Test des Werkzeugs greift auf denselben Eintrag zurück, sodass beide keine unterschiedlichen Werte nennen können.
Aufgabenspezifische Merkmale (zum Beispiel Stimmklonen oder Echtzeit-Transkription) wurden der offiziellen README oder Website des jeweiligen Projekts entnommen und am genauen Wortlaut dort geprüft. Wo die Dokumentation schweigt, zeigt die Tabelle einen Strich statt zu raten; wo eine Angabe eingeschränkt ist (experimentell, nur im bezahlten Tarif oder abhängig von einer GPU), wird das Merkmal aus der Tabelle weggelassen und stattdessen im Test des Werkzeugs behandelt.
Der Vergleich listet Werkzeuge auf, die auf Ihrer eigenen Hardware laufen. Er erstellt keine Rangliste: Welches das richtige ist, hängt von Ihrer Anforderung ab, und die Abschnitte unten zeigen, wo die tatsächlichen Unterschiede liegen.
Vergleichstabelle
Wählen Sie unten eine Aufgabe und lesen Sie dann quer durch eine Zeile. Klicken Sie auf einen Werkzeugnamen, um den vollständigen PromptQuorum-Test zu öffnen.
| Werkzeug | Preis | Lizenz | Plattformen | Ausführung | Hardware | Version | Sprachen | Stimmklonen | Streaming-Ausgabe | Nur mit CPU nutzbar | Lokaler API-Server | Test | Produktlink · offengelegt |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Bark | Kostenlos | MIT | macOS, Windows, Linux | Lokal | CPU genügt | — | 13 | Nein | — | — | — | Test lesen → | Bark |
| Coqui TTS | Kostenlos | MPL-2.0 | macOS, Windows, Linux | Lokal | CPU genügt | v0.27.5 | — | Ja | Ja | — | Ja | Test lesen → | Coqui TTS |
| Izwi | Kostenlos | MIT | macOS, Windows, Linux | Lokal | Je nach Modell unterschiedlich | v0.1.0-beta-17 | — | Ja | — | Ja | Ja | Test lesen → | Izwi |
| openai-edge-tts | Kostenlos | GPL-3.0 | macOS, Windows, Linux | Hybrid | CPU genügt | — | — | — | Ja | — | Ja | Test lesen → | openai-edge-tts |
| Piper TTS | Kostenlos | GPL-3.0 | macOS, Windows, Linux | Lokal | CPU genügt | — | — | — | — | — | Ja | Test lesen → | Piper TTS |
| StyleTTS 2 | Kostenlos | MIT | macOS, Windows, Linux | Lokal | CPU genügt | — | — | — | — | — | — | Test lesen → | StyleTTS 2 |
| Willow Inference Server | Kostenlos | Apache-2.0 | Linux, Windows | Lokal | CPU genügt | — | — | Ja | Ja | — | Ja | Test lesen → | Willow Inference Server |
| XTTS v2 | Kostenlos | CPML | macOS, Windows, Linux | Lokal | — | — | 17 | Ja | — | — | — | Test lesen → | XTTS v2 |
„—“ bedeutet, dass die eigene Dokumentation des Projekts es nicht angibt, nicht dass die Funktion fehlt. Die Werte stammen aus der offiziellen README oder Website des jeweiligen Projekts und werden erneut geprüft, wenn der Test eines Werkzeugs aktualisiert wird.
Text-zu-Sprache: Was sich unterscheidet
- Lizenz. Bark und StyleTTS 2 stehen unter MIT. Coqui TTS steht unter MPL-2.0. XTTS-v2 nutzt die Coqui Public Model License (CPML), eine eigene Lizenz mit eigenen Bedingungen statt einer Standard-Open-Source-Lizenz — lesen Sie sie vor jeder kommerziellen Nutzung. Piper und OpenAI Edge TTS stehen unter GPL-3.0, die Bedingungen für die Weitergabe veränderter Versionen stellt. Prüfen Sie die Lizenz, bevor Sie ein Produkt auf einem davon aufbauen — siehe Piper TTS und XTTS v2.
- Stimmklonen. Coqui TTS (Test), XTTS-v2 (Test), Izwi (Test) und Willow Inference Server (Test) dokumentieren Stimmklonen oder eigene Stimmen. Bark gibt an, dass es kein eigenes Stimmklonen unterstützt.
- Lokaler API-Server. Coqui TTS, Izwi, OpenAI Edge TTS, Piper und Willow Inference Server dokumentieren eine Serverkomponente, sodass andere Apps sie über HTTP aufrufen können; OpenAI Edge TTS ist darauf ausgelegt.
- Sprachen. Bark dokumentiert 13 Sprachen und XTTS-v2 dokumentiert 17. Die anderen Werkzeuge geben keine vergleichbare Anzahl an, daher zeigt die Tabelle einen Strich statt einer Zahl.
Sprache-zu-Text: Was sich unterscheidet
- Echtzeit-Transkription. whisper.cpp dokumentiert ein Echtzeit-Streaming-Beispiel, und Izwi und Willow Inference Server dokumentieren Echtzeit-Nutzung. faster-whisper ist eine Transkriptionsbibliothek; ihre eigene README dokumentiert keinen Echtzeitmodus.
- Sprecherkennzeichnung. Izwi und FunClip dokumentieren Sprecherkennzeichnung. Meetily bietet Sprechertrennung (Diarisierung) nur im bezahlten Pro-Tarif. Die Sprecherwechsel-Markierung von whisper.cpp ist experimentell und wird im zugehörigen Test statt in der Tabelle behandelt.
- Preis und Plattform. MacWhisper ist eine proprietäre macOS-App mit kostenlosem Tarif und kostenpflichtigem Upgrade; die meisten anderen Werkzeuge hier sind kostenlos und Open Source. Meetilys Community Edition ist kostenlos und steht unter MIT, mit einem bezahlten Pro-Tarif.
- Lokaler API-Server. whisper.cpp liefert einen Server mit, und Izwi und Willow Inference Server dokumentieren HTTP-APIs.
Sprachagenten: Was sich unterscheidet
- Vollständig lokal oder optionale Cloud. Jarvis dokumentiert einen lokalen Stack aus Spracheingabe, LLM und Sprachausgabe; Parlor dokumentiert eine lokale Pipeline mit optionaler Cloud-Recherchefunktion. Voxa kann einen lokalen Sprachanbieter oder Cloud-Anbieter nutzen und ist daher nur dann vollständig lokal, wenn Sie den lokalen wählen.
- Unterbrechung (Barge-in). Jarvis, Parlor und Voxa dokumentieren, dass Sie den Agenten unterbrechen können, während er spricht.
- Eigenes LLM und Telefonanrufe. Dograh dokumentiert eine Auswahl an LLMs und Telefonie-Integrationen; Voxa dokumentiert die Anbindung eines eigenen Modells über einen lokalen Daemon.
Was dieser Vergleich nicht aussagen kann
- Er vergleicht dokumentierte Fähigkeiten, nicht die Qualität. Er sagt nichts darüber, wie natürlich eine Stimme klingt oder wie genau ein Transkript ist — dafür brauchen Sie Ihr eigenes Audiomaterial und Ihre eigene Hardware.
- Er enthält keine Geschwindigkeits-Benchmarks: PromptQuorum hat diese für die Werkzeuge nicht gemessen.
- Striche sind Lücken in der Dokumentation der Projekte, keine negativen Befunde. Manche Werkzeuge unterstützen möglicherweise eine Funktion, die ihre README nicht erwähnt.
- Werkzeuge ändern sich schnell. Der Test jedes Werkzeugs nennt die Version, gegen die geprüft wurde, und dieser Leitfaden wird aktualisiert, wenn ein Test aktualisiert wird.
Häufig gestellte Fragen
Warum werden Text-zu-Sprache, Sprache-zu-Text und Sprachagenten getrennt verglichen?
Sie erfüllen verschiedene Aufgaben, daher ergeben die meisten Merkmale nur innerhalb einer Aufgabe Sinn — Stimmklonen betrifft Text-zu-Sprache, Sprecherkennzeichnung die Transkription, Unterbrechung die Sprachagenten. Ein gemeinsamer Vergleich in einer Tabelle ließe die meisten Zellen leer oder bedeutungslos.
Was bedeutet ein Strich in der Vergleichstabelle?
Er bedeutet, dass die eigene Dokumentation des Projekts dieses Merkmal nicht angibt. Er bedeutet nicht, dass die Funktion fehlt; prüfen Sie den Test des Werkzeugs oder dessen Repository.
Sind diese Werkzeuge wirklich lokal?
Sie sind dafür ausgelegt, auf Ihrer eigenen Hardware zu laufen, aber einige bieten optionale Cloud-Funktionen — etwa Parlors optionale Cloud-Recherche oder Voxas Cloud-Sprachanbieter —, und einige benötigen beim ersten Start Internet, um Modelle herunterzuladen. Der Test jedes Werkzeugs behandelt das.
Hat eines dieser Werkzeuge einen Affiliate-Link?
Nein. PromptQuorum hat zum Zeitpunkt der Erstellung keine Affiliate-Beziehung zu einem Werkzeug in diesem Vergleich, und kein Link hier bringt eine Provision.
Wie oft wird dieser Vergleich aktualisiert?
Er wird zweimal im Jahr aktualisiert sowie immer dann, wenn der Test eines der aufgeführten Werkzeuge aktualisiert wird, weil die Tabelle aus denselben Daten wie diese Tests erzeugt wird.
Quellen
- Die offizielle README oder Website jedes Werkzeugs, aufgeführt im PromptQuorum-Test des Werkzeugs (in der Vergleichstabelle verlinkt).
- PromptQuorum-Verzeichnis lokaler KI-Apps — der Datensatz, aus dem jede Zeile der Tabelle erzeugt wird.
- KI-Werkzeug-Lizenzen erklärt — was die oben genannten Lizenzfamilien bedeuten.