Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/StyleTTS 2 im Test (2026): Columbias MIT-lizenziertes Forschungsmodell für natürliche Sprache
Voice, Speech & Multimodal

StyleTTS 2 im Test (2026): Columbias MIT-lizenziertes Forschungsmodell für natürliche Sprache

·12 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

StyleTTS 2 ist ein quelloffenes, forschungsorientiertes Text-zu-Sprache-Modell der Columbia University, das natürlich klingende Sprache mittels Style-Diffusion und adversarialem Training mit großen Sprachmodellen für Audio erzeugt. Der Code steht unter der MIT-Lizenz, installiert mit git clone https://github.com/yl4579/StyleTTS2.git && pip install -r requirements.txt. Das README fügt eine separate, nicht-lizenzrechtliche Bedingung für die vortrainierten Modellgewichte hinzu (Offenlegung, dass Sprache synthetisiert wurde, sofern keine Erlaubnis des Sprechers vorliegt), und das öffentliche GitHub-Repository zeigt seit dem 7. März 2024 keine Commits mehr. Für einen vollständigen Lizenzvergleich über lokale TTS-Engines hinweg siehe PromptQuorums Leitfaden zu lokalen TTS-Lizenzen.

StyleTTS 2 ist ein quelloffenes Text-zu-Sprache-Modell von Forschern der Columbia University, veröffentlicht auf GitHub, das natürlich klingende Sprache mittels Style-Diffusion und adversarialem Training mit großen Sprachmodellen für Audio erzeugt. Der Code steht unter der MIT-Lizenz, doch das README fügt eine separate, nicht-lizenzrechtliche Offenlegungsbedingung für die vortrainierten Modellgewichte hinzu, und das öffentliche Repository zeigt seit dem 7. März 2024 keine Commits mehr. Dieser Test behandelt, was StyleTTS 2 tatsächlich tut, echte Installations- und Inferenzbefehle, die Lizenz-Nuance zwischen dem MIT-Code und den bedingten Modellgewichten sowie seinen ruhenden, aber nicht archivierten Pflegestatus — das ehrliche Bild für jeden, der es 2026 evaluiert.

StyleTTS 2 im Test (2026): Columbias MIT-lizenziertes Forschungsmodell für natürliche Sprache

Wichtigste Erkenntnisse

  • Natürlich klingende Sprache mittels Style-Diffusion und adversarialem Training, laut NeurIPS-Paper auf Augenhöhe mit oder besser als menschliche Aufnahmen bei Standard-Einzelsprecher-Benchmarks.
  • Code-Lizenz: MIT. Vortrainierte Modellgewichte tragen eine separate README-Offenlegungsbedingung, die nicht im MIT-Lizenztext kodiert ist.
  • Zero-Shot-Stiltransfer aus einem 5-10 Sekunden langen Referenzclip über den LibriTTS-Multi-Speaker-Checkpoint (empfohlen: 15-30 Sekunden).
  • Die offizielle Inferenz benötigt das GPL-3.0-lizenzierte espeak-ng; ein Community-pip-Paket umgeht dies, wurde aber zuletzt am 11. Januar 2024 veröffentlicht.
  • Keine Commits im offiziellen Repository seit dem 7. März 2024; nicht archiviert, über 6.300 GitHub-Sterne.
  • Vortrainierte Checkpoints sind vorrangig Englisch; der Text-Aligner wurde zudem auf japanischen und chinesischen Korpora trainiert und generalisiert Berichten zufolge auf einige andere Sprachen ohne Fine-Tuning.

📍 In einem Satz

StyleTTS 2 ist Columbia Universitys MIT-lizenziertes, forschungsorientiertes Text-zu-Sprache-Modell, das mittels Style-Diffusion und adversarialem Training natürlich klingende Sprache erzeugt, mit einer dokumentationsseitigen Offenlegungsbedingung für seine vortrainierten Gewichte und ohne GitHub-Commits seit dem 7. März 2024.

💬 In einfachen Worten

Es ist ein kostenloses, herunterladbares KI-Modell, das Text in sehr natürlich klingende Sprache verwandelt, entwickelt von Universitätsforschern statt einem Unternehmen — kostenlos kommerziell nutzbar laut Code-Lizenz, doch die eigene Anleitung bittet darum, Hörern mitzuteilen, dass die Sprache synthetisiert wurde, und niemand scheint noch aktiv Fehler darin zu beheben.

📌Hinweis: Ein GitHub-Issue zum Projekt (#37) wies darauf hin, dass die Offenlegungspflicht des READMEs für vortrainierte Modelle außerhalb der eigentlichen MIT-Lizenzdatei liegt, was manche Leser verwirrend finden. Lesen Sie sowohl die LICENSE-Datei als auch den Modellnutzungsabschnitt des READMEs selbst, bevor Sie es einsetzen — siehe den Abschnitt Lizenz und Kosten unten.

Geschichte: Ein Columbia-Forschungsprojekt

StyleTTS 2 wurde von Forschern der Fakultät für Elektrotechnik der Columbia University entwickelt — Yinghao Aaron Li, Cong Han, Vinay S. Raghavan, Gavin Mischler und Nima Mesgarani — und als NeurIPS-2023-Paper mit dem Titel „StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models" veröffentlicht.

Die zentrale These des Papers ist, dass die Kombination aus Style-Diffusion (Modellierung des Sprechstils als latente Wahrscheinlichkeitsverteilung statt als einzelner fester Vektor) und adversarialem Training gegen große vortrainierte Sprachmodelle für Audio menschenähnliche Sprachvariation genauer modelliert als frühere Ansätze. Beim Einzelsprecher-Benchmark LJSpeech berichtet das Paper, dass StyleTTS 2 in Hörerbewertungen echte menschliche Sprachaufnahmen erreicht oder übertrifft; beim Multi-Speaker-Datensatz LibriTTS übertrifft es demnach zuvor verfügbare öffentliche Modelle bei der Zero-Shot-Sprecheranpassung.

Das öffentliche yl4579/StyleTTS2-GitHub-Repository hat über 6.300 Sterne gesammelt und ist nicht als archiviert markiert — doch PromptQuorum fand seit dem 7. März 2024 keine Commits mehr im Hauptzweig des Repositorys, basierend auf der öffentlichen Commit-Historie des Projekts. Das passt eher zu einer universitären Forschungsveröffentlichung als zu einem kommerziell gepflegten Open-Source-Produkt: Code, Paper und vortrainierte Checkpoints wurden begleitend zur Forschung veröffentlicht, ohne laufende Verpflichtung zu Feature-Entwicklung oder Bugfix-Releases.

Ein community-gepflegtes pip-Paket, styletts2 des Entwicklers Sidharth Rajaram, verpackt den ursprünglichen Forschungscode in ein installierbares Paket (pip install styletts2), das den GPL-3.0-lizenzierten Phonemizer espeak-ng gegen die MIT-lizenzierte Bibliothek gruut austauscht, um die gesamte Installationskette freizügig lizenziert zu halten. Das jüngste Release auf PyPI ist Version 0.1.6, veröffentlicht am 11. Januar 2024 — zum Zeitpunkt dieses Tests ebenfalls über zweieinhalb Jahre alt und ein separates Drittprojekt, losgelöst vom ursprünglichen Columbia-Forschungscode.

Wer hat StyleTTS 2 entwickelt?

StyleTTS 2 wurde von Yinghao Aaron Li, Cong Han, Vinay S. Raghavan, Gavin Mischler und Nima Mesgarani entwickelt, Forschern der Fakultät für Elektrotechnik der Columbia University, und als NeurIPS-2023-Paper veröffentlicht.

Was StyleTTS 2 tatsächlich tut

StyleTTS 2 ist ein Text-zu-Sprache-Modell, das aus Eingabetext ein Mel-Spektrogramm (und in seiner End-to-End-Konfiguration eine rohe Wellenform) erzeugt, wobei ein Diffusionsmodell einen latenten „Stil"-Vektor abtastet, statt ihn deterministisch vorherzusagen — dieser Mechanismus wird im Paper als Ursache für natürlichere, menschenähnlichere Prosodie genannt.

  • Style-Diffusion für natürliche Prosodie. Statt aus dem Text ein einzelnes festes Stil-Embedding vorherzusagen, tastet StyleTTS 2 mittels Diffusion aus einer gelernten Wahrscheinlichkeitsverteilung über Stile ab, was laut Paper natürlichere Variation in Tonhöhe, Rhythmus und Betonung erzeugt als deterministische Ansätze.
  • Adversariales Training gegen Sprachmodelle für Audio. Der Trainingsprozess stellt das TTS-Modell gegen große vortrainierte Sprachmodelle für Audio (SLMs) als Diskriminatoren — eine Technik, der das Paper zuschreibt, die verbleibende Lücke zur Qualität menschlicher Aufnahmen beim LJSpeech-Benchmark zu schließen.
  • Zwei offiziell veröffentlichte vortrainierte Checkpoints. StyleTTS2-LJSpeech (einzelner englischer Sprecher, 24kHz) und StyleTTS2-LibriTTS (mehrere englische Sprecher) sind beide auf Hugging Face gehostet.
  • Zero-Shot-Stiltransfer aus Referenzaudio. Der LibriTTS-Multi-Speaker-Checkpoint kann neuen Text in einem aus einem Referenz-Audioclip erfassten Stil synthetisieren — die eigene Dokumentation des Projekts und Anleitungen Dritter beschreiben ein Minimum von 5-10 Sekunden, wobei 15-30 Sekunden sauberes Einzelsprecher-Referenzaudio für genaue Klangfarbe, Prosodie und Aussprache empfohlen werden.
  • Vorrangig englische vortrainierte Checkpoints, mit etwas mehrsprachiger Vorarbeit. Die offiziell veröffentlichten Checkpoints sind auf englischen Datensätzen (LJSpeech, LibriTTS) trainiert. Das Paper vermerkt, dass die Text-Aligner-Komponente auch auf japanischen (JVS) und chinesischen (AiShell) Korpora vortrainiert wurde und „für die meisten anderen Sprachen ohne Fine-Tuning gut funktioniert", und verweist auf ein mehrsprachiges PL-BERT-Modell für 14 Sprachen als Ausgangspunkt, um selbst ein nicht-englisches StyleTTS-2-Modell zu trainieren — es gibt jedoch keinen offiziell veröffentlichten, einsatzbereiten nicht-englischen Checkpoint.

StyleTTS 2 installieren und ausführen: Schritt für Schritt

Diese Anleitung folgt dem vom Projekt selbst dokumentierten Setup für die Inferenz mit einem vortrainierten Checkpoint.

  1. 1
    Repository klonen und Abhängigkeiten installieren.
    Why it matters: Führen Sie `git clone https://github.com/yl4579/StyleTTS2.git && cd StyleTTS2 && pip install -r requirements.txt` aus. Dies installiert die in der eigenen Requirements-Datei des Projekts gelisteten Kernabhängigkeiten.
  2. 2
    Phonemizer und espeak-ng installieren.
    Why it matters: Führen Sie `pip install phonemizer` und unter Linux `sudo apt-get install espeak-ng` aus (oder das Äquivalent für Ihr Betriebssystem). Beachten Sie, dass espeak-ng selbst unter GPL-3.0 lizenziert ist — siehe den Abschnitt Lizenz und Kosten, warum das für den Inferenzpfad relevant ist, nicht nur für den StyleTTS-2-Code selbst.
  3. 3
    Einen vortrainierten Checkpoint herunterladen.
    Why it matters: Laden Sie entweder [StyleTTS2-LJSpeech](https://huggingface.co/yl4579/StyleTTS2-LJSpeech/tree/main) (einzelner Sprecher) oder [StyleTTS2-LibriTTS](https://huggingface.co/yl4579/StyleTTS2-LibriTTS/tree/main) (mehrere Sprecher, unterstützt Stiltransfer) von Hugging Face in das Projektverzeichnis herunter.
  4. 4
    Inferenz über die mitgelieferten Notebooks ausführen.
    Why it matters: Das Projekt liefert `Demo/Inference_LJSpeech.ipynb` und `Demo/Inference_LibriTTS.ipynb` — öffnen Sie das zu Ihrem heruntergeladenen Checkpoint passende in Jupyter, um das Modell zu laden und Ihr erstes Sample zu synthetisieren.
  5. 5
    (Alternative) Das Community-pip-Paket für eine einfachere, rein MIT-lizenzierte Installationskette nutzen.
    Why it matters: Führen Sie `pip install styletts2` aus, dann `from styletts2 import tts; my_tts = tts.StyleTTS2(); my_tts.inference("Hallo.", output_wav_file="test.wav")`. Dieses Drittanbieter-Paket (zuletzt veröffentlicht am 11. Januar 2024) verwendet die MIT-lizenzierte Bibliothek gruut statt espeak-ng und vermeidet so die GPL-3.0-Abhängigkeit — auf Kosten der Abhängigkeit von einem ebenfalls ruhenden, inoffiziellen Wrapper.
  6. 6
    (Optional) Einen Referenzclip für Stiltransfer bereitstellen.
    Why it matters: Übergeben Sie beim LibriTTS-Checkpoint ein `target_voice_path`-Argument (Community-Paket) oder den entsprechenden Referenzaudio-Parameter (offizielles Notebook), das auf eine saubere, 15-30 Sekunden lange Einzelsprecher-WAV-Datei verweist, um neuen Text in diesem erfassten Stil zu synthetisieren.

Echte Nutzungsbeispiele

Diese Beispiele zeigen sowohl die vereinfachte API des Community-pip-Pakets als auch das Muster aus den offiziellen Inferenz-Notebooks des Projekts.

  • Die Qualität des Referenzaudios ist für den Stiltransfer entscheidend. Ein sauberer, 15-30 Sekunden langer Einzelsprecher-Clip erzeugt einen merklich besseren Stiltransfer als eine kurze, verrauschte oder Multi-Speaker-Referenz.
  • Es existieren zwei separate Abhängigkeitsketten. Der Notebook-Pfad des offiziellen Repositorys zieht das GPL-3.0-lizenzierte espeak-ng nach sich; das Community-pip-Paket vermeidet dies stattdessen mit gruut — wählen Sie die Kette passend zu Ihren Lizenzanforderungen, bevor Sie Tooling um eine der beiden herum aufbauen.
python
# Einfachster Weg: Community-pip-Paket (rein MIT-lizenzierte Abhängigkeitskette,
# zuletzt veröffentlicht am 2024-01-11 — vor Abhängigkeit selbst verifizieren)
pip install styletts2

from styletts2 import tts

my_tts = tts.StyleTTS2()
my_tts.inference(
    "Hello there, this is a natural-sounding synthesized sentence.",
    output_wav_file="test.wav",
)

# Zero-Shot-Stiltransfer aus einem Referenzclip (LibriTTS-artiger Checkpoint)
my_tts.inference(
    "The same text, now spoken in a captured reference style.",
    target_voice_path="reference_voice.wav",
    output_wav_file="styled_test.wav",
)

# Benutzerdefinierter Checkpoint- und Konfigurationspfad
custom_tts = tts.StyleTTS2(
    model_checkpoint_path="/path/to/epochs_2nd_00020.pth",
    config_path="/path/to/config.yml",
)

# --- Offizieller Repository-Pfad (benötigt espeak-ng, GPL-3.0) ---
# git clone https://github.com/yl4579/StyleTTS2.git
# cd StyleTTS2 && pip install -r requirements.txt
# pip install phonemizer && sudo apt-get install espeak-ng
# Öffnen Sie dann Demo/Inference_LJSpeech.ipynb oder Demo/Inference_LibriTTS.ipynb
# in Jupyter und führen Sie die mitgelieferten Zellen mit Ihrem heruntergeladenen Checkpoint aus.

Lizenz und Kosten

Der Code von StyleTTS 2 steht unter der MIT-Lizenz, bestätigt über die LICENSE-Datei im offiziellen Repository. MIT ist eine freizügige Lizenz: Sie dürfen den Code mit minimalen Einschränkungen nutzen, verändern und weitergeben, auch kommerziell.

Die vortrainierten Modellgewichte tragen eine separate, nicht-lizenzrechtliche Bedingung, die im README steht, nicht in der LICENSE-Datei selbst. Das README des Projekts bittet Nutzer, „Hörern mitzuteilen, dass Sprachbeispiele von StyleTTS-2-Modellen synthetisiert wurden, sofern Sie nicht die Erlaubnis haben, die synthetisierte Stimme zu verwenden". Dies ist eine Bitte auf Dokumentationsebene, keine formale Lizenzklausel — ein GitHub-Issue zum Projekt (#37) wies ausdrücklich darauf hin, dass dies potenziell verwirrend sei, da das Lizenz-Badge und die LICENSE-Datei des Repositorys einem Leser, der nicht auch den Modellnutzungsabschnitt des READMEs liest, nahelegen, dass nur MIT-Bedingungen gelten. PromptQuorum fand im öffentlichen Issue-Thread keine Antwort der Maintainer, die diese Unklarheit auflöst. Behandeln Sie die Offenlegungsbedingung als reale, dokumentierte Bitte der Autoren und befolgen Sie sie — verstehen Sie aber, dass sie außerhalb der formalen MIT-Gewährung für den Code selbst liegt, eine tatsächlich ungewöhnliche Struktur, die vor kommerzieller Nutzung erwähnenswert ist.

Die offizielle Inferenz zieht eine GPL-3.0-lizenzierte Abhängigkeit nach sich: espeak-ng. Die eigenen Installationsanweisungen des Projekts verlangen pip install phonemizer plus eine systemweite Installation von espeak-ng, und espeak-ng steht unter GPL-3.0. GPL-3.0 ist eine Copyleft-Lizenz mit Verbreitungspflichten, die sich von MIT unterscheiden; die Nutzung von espeak-ng als unveränderte externe Systemabhängigkeit wird in der Regel anders behandelt als das statische Einbinden oder Weiterverbreiten seines veränderten Quellcodes, doch die genaue Grenze hängt von Ihrer konkreten Bereitstellung ab. Das Community-pip-Paket styletts2 umgeht dieses spezifische Problem, indem es die MIT-lizenzierte Bibliothek gruut statt espeak-ng verwendet — ein echter praktischer Unterschied, wenn Sie eine durchgehend freizügig lizenzierte Abhängigkeitskette wollen, auf Kosten der Abhängigkeit von einem Drittanbieter-Paket mit einem noch älteren letzten Release-Datum (11. Januar 2024) als das offizielle Repository.

Nichts davon ist Rechtsberatung. Lesen Sie die LICENSE-Datei, den Modellnutzungsabschnitt des READMEs und konsultieren Sie einen Anwalt für Ihre konkrete Bereitstellung, bevor Sie StyleTTS 2 in einem kommerziellen Produkt ausliefern.

Welche Lizenz verwendet StyleTTS 2?

Der Code von StyleTTS 2 steht unter MIT. Die vortrainierten Modellgewichte tragen eine separate, nicht-lizenzrechtliche Bedingung im README des Projekts (Offenlegung synthetisierter Sprache, sofern keine Erlaubnis des Sprechers vorliegt), die nicht Teil des formalen MIT-Lizenztextes ist — eine Unterscheidung, auf die ein GitHub-Issue zum Projekt als potenziell verwirrend hinwies. Dies ist keine Rechtsberatung; lesen Sie die LICENSE-Datei und das README selbst, bevor Sie es kommerziell nutzen.

Wofür StyleTTS 2 nicht geeignet ist

StyleTTS 2 ist ein forschungsorientiertes Modell mit tatsächlich starker Ausgabequalität, kein ausgereiftes, aktiv gepflegtes Verbraucherprodukt. Es ist das falsche Werkzeug für die folgenden Situationen:

  • Leser, die eine einfache Pip-Install-und-los-Erfahrung wollen. Anders als Piper, das mit pip install piper-tts und einem einzigen CLI-Befehl zu funktionierendem Audio führt, umfasst der offizielle StyleTTS-2-Pfad das Klonen eines Forschungs-Repositorys, die Installation eines Phonemizers, eine systemweite espeak-ng-Abhängigkeit und das Ausführen von Jupyter-Notebooks — eine merklich höhere Einstiegshürde.
  • Produktiveinsatz ohne ML-Engineering-Aufwand. Es gibt keinen gepflegten Webserver-Modus, kein offizielles Docker-Image und kein Unternehmen, das laufenden Support bereitstellt. Wer StyleTTS 2 produktiv einsetzt, sollte einplanen, eine eigene Serving-Schicht rund um den Forschungscode zu schreiben und zu pflegen.
  • Garantierte laufende Fehlerbehebungen oder Feature-Updates. Ohne Commits im offiziellen Repository seit dem 7. März 2024 und mit dem letzten Release des Community-pip-Pakets vom 11. Januar 2024 sollten Sie für keine der beiden Abhängigkeitsketten aktive Pflege annehmen — kalkulieren Sie ein, bei jedem auftretenden Problem auf sich allein gestellt zu sein.
  • Einsatzbereite nicht-englische Sprache. Die offiziell veröffentlichten vortrainierten Checkpoints sind ausschließlich Englisch (LJSpeech, LibriTTS). Ein nicht-englisches Modell selbst zu trainieren ist laut den Anmerkungen des Papers zum mehrsprachigen Text-Aligner und PL-BERT architektonisch möglich, erfordert aber einen eigenen Trainingslauf — es gibt keinen herunterladbaren nicht-englischen Checkpoint vom Projekt.
  • Eine einzige, eindeutige Lizenzgewährung für alles, was Sie herunterladen. Da Code (MIT) und vortrainierte Gewichte (MIT plus README-Offenlegungsbedingung) leicht unterschiedlich geregelt sind und der offizielle Inferenzpfad eine GPL-3.0-Abhängigkeit nach sich zieht, bietet StyleTTS 2 nicht die einfache, eindeutige Lizenzgeschichte, die ein Projekt wie Bark (vollständig MIT, keine zusätzlichen Bedingungen) hat.

Alternativen zu StyleTTS 2

Piper

Am besten für:
Einfaches Pip-Install-und-los-Setup, schnellste reine CPU-Synthese, Echtzeit auf Raspberry Pi
Lizenz:
GPL-3.0-or-later

XTTS v2

Am besten für:
Verpacktes Voice-Cloning aus 6 Sekunden Referenzaudio, 17 Sprachen
Lizenz:
CPML (nicht-kommerziell)

Coqui-TTS-Toolkit

Am besten für:
Flexibles Multi-Backend-Toolkit mit breiter Sprachunterstützung und gepflegtem Fork
Lizenz:
MPL-2.0

Bark

Am besten für:
Ausdrucksstarkes, nicht-sprachliches Audio — Lachen, Seufzer, Umgebungsgeräusche, einzige eindeutige MIT-Lizenz
Lizenz:
MIT

ElevenLabs

Am besten für:
Verwaltete Cloud-API mit kommerziellem Voice-Cloning und aktivem Support, kein Selbst-Hosting-Aufwand
Lizenz:
Proprietär (kostenpflichtige Cloud-API)

Häufig gestellte Fragen

Was ist StyleTTS 2?

StyleTTS 2 ist ein quelloffenes Text-zu-Sprache-Modell von Forschern der Columbia University, das mittels Style-Diffusion und adversarialem Training mit großen Sprachmodellen für Audio natürlich klingende Sprache erzeugt, veröffentlicht als NeurIPS-2023-Paper.

Ist StyleTTS 2 kostenlos kommerziell nutzbar?

Der Code steht unter MIT, was kommerzielle Nutzung erlaubt. Die vortrainierten Modellgewichte tragen im README eine separate, nicht-lizenzrechtliche Bedingung, die Sie bittet, synthetisierte Sprache offenzulegen, sofern Sie nicht die Erlaubnis des Sprechers haben. Dies ist keine Rechtsberatung; lesen Sie die LICENSE-Datei und das README selbst, bevor Sie es kommerziell einsetzen.

Kann StyleTTS 2 eine Stimme klonen?

Der LibriTTS-Multi-Speaker-Checkpoint unterstützt Zero-Shot-Stiltransfer aus einem Referenz-Audioclip (mindestens 5-10 Sekunden, empfohlen 15-30 Sekunden), was dem Voice-Cloning im Geiste ähnelt. Es ist nicht als einfache Ein-Klick-Cloning-Funktion verpackt wie bei XTTS v2 — die Nutzung erfordert den Notebook-basierten offiziellen Workflow oder das Community-pip-Paket.

Wird StyleTTS 2 noch gepflegt?

Das offizielle GitHub-Repository ist nicht als archiviert markiert, doch PromptQuorum fand seit dem 7. März 2024 keine Commits mehr. Das Community-pip-Paket, das die Installation vereinfacht, wurde zuletzt am 11. Januar 2024 veröffentlicht. Behandeln Sie beide als ruhende Forschungsartefakte statt als aktiv entwickelte Software.

Unterstützt StyleTTS 2 andere Sprachen als Englisch?

Die offiziell veröffentlichten vortrainierten Checkpoints (LJSpeech, LibriTTS) sind ausschließlich Englisch. Das Paper vermerkt, dass die Text-Aligner-Komponente auch auf japanischen und chinesischen Korpora trainiert wurde und ohne Fine-Tuning einigermaßen auf andere Sprachen generalisiert, und verweist auf ein mehrsprachiges PL-BERT-Modell für 14 Sprachen als Ausgangspunkt, um selbst ein eigenes nicht-englisches Modell zu trainieren — es gibt jedoch keinen einsatzbereiten, offiziell veröffentlichten nicht-englischen Checkpoint.

Warum benötigt die offizielle Installation von StyleTTS 2 espeak-ng, und warum ist das wichtig?

Der offizielle Inferenzpfad nutzt die Phonemizer-Bibliothek mit espeak-ng als Backend zur Umwandlung von Text in Phoneme. espeak-ng steht unter GPL-3.0, einer Copyleft-Lizenz mit anderen Verbreitungspflichten als MIT. Ein Community-pip-Paket (styletts2) umgeht dies, indem es stattdessen die MIT-lizenzierte Bibliothek gruut verwendet — auf Kosten der Abhängigkeit von einem noch älteren, inoffiziellen Release (zuletzt aktualisiert am 11. Januar 2024).

Wie schneidet StyleTTS 2 im Vergleich zu XTTS v2 ab?

Der Code von StyleTTS 2 steht unter MIT und ist kostenlos kommerziell nutzbar (mit der README-Offenlegungsbedingung für die Gewichte); XTTS v2 steht unter der nicht-kommerziellen Coqui Public Model License. Das offizielle Setup von StyleTTS 2 ist forschungsorientierter und erfordert mehr manuelle Arbeit; XTTS v2 liefert über das Coqui-TTS-Toolkit eine einfachere, verpackte Voice-Cloning-API. Wählen Sie basierend auf Ihren Lizenzanforderungen und Ihrer Toleranz für Setup-Komplexität.

Fazit

StyleTTS 2 bleibt bei der Ausgabequalität wirklich beeindruckend: Sein Ansatz aus Style-Diffusion und adversarialem Training wird im eigenen NeurIPS-Paper als Erreichen oder Übertreffen der Qualität menschlicher Aufnahmen beim LJSpeech-Benchmark angeführt, unter einer Code-Lizenz (MIT), die kaum freizügiger sein könnte. Was es für die meisten Leser zu keiner einfachen Empfehlung macht, ist alles rund um dieses Kernmodell: eine dokumentationsseitige Offenlegungsbedingung für die vortrainierten Gewichte, die außerhalb der formalen MIT-Gewährung liegt, ein offizieller Inferenzpfad, der eine GPL-3.0-Abhängigkeit nach sich zieht, ein Community-pip-Paket, das diese Abhängigkeit vermeidet, aber selbst über zweieinhalb Jahre veraltet ist, und keine Commits im offiziellen Repository seit dem 7. März 2024. Wenn Sie die höchste verfügbare natürlich klingende englische Erzählqualität lokal wollen und mit forschungsorientiertem Setup sowie einer ungepflegten Abhängigkeitskette einverstanden sind, liefert StyleTTS 2. Wenn Sie eine einfachere Installation, aktive Pflege oder verpacktes Voice-Cloning wollen, kombinieren Sie diesen Test mit PromptQuorums Abdeckung von Piper für schnelle reine CPU-Synthese, XTTS v2 für verpacktes Voice-Cloning oder dem ElevenLabs-Vergleich für eine vollständig verwaltete Alternative. Dieser Test ist der letzte von sechs lokalen Sprach-zu-Text- und Text-zu-Sprache-Engines, die PromptQuorum ausführlich getestet hat, neben Whisper.cpp, Faster Whisper, Piper, Coqui TTS, XTTS v2 und Bark.

Quellen

← Zurück zu Lokale LLMs Pro