Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/XTTS v2 im Test (2026): Mehrsprachiges Voice-Cloning aus 6 Sekunden Audio
Voice, Speech & Multimodal

XTTS v2 im Test (2026): Mehrsprachiges Voice-Cloning aus 6 Sekunden Audio

·12 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

XTTS v2 ist ein mehrsprachiges Voice-Cloning-Modell von Coqui, das eine Stimme aus nur 6 Sekunden Referenzaudio klont und Sprache in dieser Stimme in 17 Sprachen erzeugt. Es läuft über das Coqui-TTS-Toolkit (pip install coqui-tts, dann TTS("tts_models/multilingual/multi-dataset/xtts_v2")). Seine Lizenz, die Coqui Public Model License (CPML), ist nicht-kommerziell — und da Coqui AI, das Unternehmen, seine kostenpflichtigen Dienste im Dezember 2023 einstellte, gibt es derzeit keinen aktiven Weg zu einer kommerziellen Lizenz. Für einen vollständigen Lizenzvergleich über lokale TTS-Engines hinweg siehe PromptQuorums Leitfaden zu lokalen TTS-Lizenzen.

XTTS v2 ist ein mehrsprachiges Voice-Cloning-Modell von Coqui, veröffentlicht auf Hugging Face, das eine Stimme aus nur 6 Sekunden Referenzaudio klont und sie in 17 Sprachen sprechen lässt. Es läuft über das Coqui-TTS-Toolkit — der aktiv gepflegte Fork ist idiap/coqui-ai-TTS — oder kann eigenständig über die Modellgewichte verwendet werden. Dieser Test behandelt, was XTTS v2 tatsächlich tut, echte Nutzungsbefehle, seine Lizenz (die Coqui Public Model License, CPML, die nicht-kommerziell ist) und wo es das richtige Werkzeug ist und wo nicht — denn Coqui AI, das Unternehmen, das es ursprünglich veröffentlichte, stellte seine kostenpflichtigen Dienste im Dezember 2023 ein.

XTTS v2 im Test (2026): Mehrsprachiges Voice-Cloning aus 6 Sekunden Audio

Wichtigste Erkenntnisse

  • Klont eine Stimme aus nur 6 Sekunden Referenzaudio, über 17 Sprachen hinweg.
  • Läuft über das Coqui-TTS-Toolkit (pip install coqui-tts) oder direkt über seine Hugging-Face-Modellgewichte.
  • Lizenz: Coqui Public Model License (CPML) — nur nicht-kommerziell.
  • Kein aktiver kommerzieller Lizenzweg: Coqui AI stellte seine kostenpflichtigen Dienste im Dezember 2023 ein.
  • Dokumentierte Streaming-Latenz unter 200 ms bis zum ersten Audio; GPU dringend empfohlen.
  • Erfordert die Akzeptanz der CPML — setzen Sie COQUI_TOS_AGREED=1, um dies nicht-interaktiv in Docker oder CI zu tun.

📍 In einem Satz

XTTS v2 ist Coquis mehrsprachiges Voice-Cloning-Modell, das eine Stimme aus 6 Sekunden Referenzaudio klont und in 17 Sprachen sprechen lässt, lizenziert unter der nicht-kommerziellen Coqui Public Model License (CPML), ohne aktiven kommerziellen Lizenzweg, seit Coqui AI, das veröffentlichende Unternehmen, seine kostenpflichtigen Dienste im Dezember 2023 einstellte.

💬 In einfachen Worten

Es ist ein KI-Modell, das sich einen kurzen Sprachclip anhört und dann neue Sätze in genau dieser Stimme erzeugen kann, in 17 verschiedenen Sprachen — kostenlos für private und Forschungsnutzung, aber nicht für ein bezahltes Produkt ohne eine separate Vereinbarung, die derzeit nicht existiert.

📌Hinweis: Die CPML ist nicht dieselbe Lizenz wie das Coqui-TTS-Toolkit, das XTTS v2 ausführt — das Toolkit ist MPL-2.0, doch die Gewichte und Ausgaben dieses spezifischen Modells sind nicht-kommerziell. Siehe Abschnitt Lizenz und kommerzielle Nutzung unten.

Was XTTS v2 tatsächlich tut

XTTS v2 ist ein GPT-basiertes, sprachübergreifendes Voice-Cloning-Text-zu-Sprache-Modell. Bei einem kurzen Referenzaudioclip und Zieltext erzeugt es Sprache in der geklonten Stimme, auch in einer anderen Sprache als das Referenzaudio.

  • Voice-Cloning in wenigen Sekunden. Ein einziger 6-Sekunden-Referenzaudioclip reicht laut Coquis offizieller Model-Card zum Klonen einer Stimme — kein Fine-Tuning oder Trainingslauf für eine neue Stimme erforderlich.
  • Unterstützung für 17 Sprachen mit sprachübergreifendem Cloning. Unterstützte Sprachen sind Englisch, Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch, Polnisch, Türkisch, Russisch, Niederländisch, Tschechisch, Arabisch, Chinesisch (zh-cn), Japanisch, Ungarisch, Koreanisch und Hindi — Sie können eine Stimme aus englischem Audio klonen und mit derselben geklonten Stimme Sprache in jeder der anderen 16 Sprachen erzeugen.
  • Streaming-Inferenz. XTTS v2 unterstützt Streaming-Synthese mit Latenz unter 200 ms bis zum ersten Audio, dokumentiert seit Einführung dieser Funktion in Coqui TTS v0.20.0 — nützlich für interaktive Sprachanwendungen, bei denen das Warten auf eine vollständig gerenderte Audiodatei zu langsam ist.
  • Läuft über das Coqui-TTS-Toolkit. Der primäre unterstützte Weg, XTTS v2 auszuführen, ist über Coqui TTS (pip install coqui-tts), das es als TTS("tts_models/multilingual/multi-dataset/xtts_v2") bereitstellt.
  • Wiederverwendung von Speaker-Embeddings. Über das jedes Mal erneute Übergeben eines rohen Referenzclips hinaus unterstützt das Toolkit das Berechnen und Wiederverwenden des latenten Embeddings eines Sprechers, was erneute Berechnungen bei wiederholter Synthese mit derselben geklonten Stimme vermeidet.

Echte Nutzungsbeispiele

Diese Befehle verwenden die dokumentierte Python-API des Coqui-TTS-Toolkits, den primären unterstützten Weg, XTTS v2 auszuführen.

  • Die Qualität des Referenzaudios ist entscheidend. Ein sauberer 6-Sekunden-Clip eines einzelnen Sprechers ohne Hintergrundgeräusche oder Musik erzeugt einen merklich besseren Klon als ein kurzer, verrauschter oder Multi-Speaker-Clip.
  • Nicht-interaktive CPML-Akzeptanz ist beim ersten Laden von XTTS v2 in einer unbeaufsichtigten Umgebung (Docker, CI) erforderlich — setzen Sie COQUI_TOS_AGREED=1 vor diesem ersten Laden.
python
# Toolkit installieren
pip install coqui-tts

# CPML nicht-interaktiv akzeptieren (erforderlich für Docker/CI; sonst
# erscheint beim ersten Laden eine interaktive Eingabeaufforderung)
export COQUI_TOS_AGREED=1

# Python-API: Stimme klonen und Sprache erzeugen
import torch
from TTS.api import TTS

device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)

# Cloning in derselben Sprache
tts.tts_to_file(
    text="This is a cloned voice speaking a new sentence.",
    speaker_wav="reference_voice.wav",
    language="en",
    file_path="output_en.wav",
)

# Sprachübergreifendes Cloning: aus englischem Audio klonen, Spanisch sprechen
tts.tts_to_file(
    text="Esta es la misma voz clonada, ahora hablando en español.",
    speaker_wav="reference_voice.wav",
    language="es",
    file_path="output_es.wav",
)

# Streaming-Synthese (niedrige Latenz bis zum ersten Audio)
for chunk in tts.tts_stream(
    text="Streaming audio, chunk by chunk, for interactive use.",
    speaker_wav="reference_voice.wav",
    language="en",
):
    play_audio(chunk)

Lizenz und kommerzielle Nutzung

Die Modellgewichte und generierten Audio-Ausgaben von XTTS v2 stehen unter der Coqui Public Model License (CPML) 1.0.0, bestätigt über die zusammen mit dem Modell auf Hugging Face veröffentlichte Lizenzdatei. Die CPML besagt ausdrücklich, dass sie „nur die nicht-kommerzielle Nutzung eines Machine-Learning-Modells und seiner Ausgaben erlaubt" — erlaubte Nutzungen umfassen private Projekte, akademische Forschung und Hobby-Arbeit, solange Sie keine direkte oder indirekte Vergütung im Zusammenhang mit dieser Nutzung erhalten.

Derzeit gibt es keinen aktiven kommerziellen Lizenzweg für XTTS v2. Die Model-Card listet eine Kontaktadresse, info@coqui.ai, für Anfragen zu kommerziellen Lizenzen, doch Coqui AI, das Unternehmen, stellte seine kostenpflichtigen Dienste im Dezember 2023 ein — PromptQuorum konnte nicht bestätigen, dass diese Adresse noch aktiv besetzt ist oder dass eine kommerzielle Lizenz heute erhältlich ist. Behandeln Sie XTTS v2 als ausschließlich nicht-kommerziell, es sei denn, Sie bestätigen unabhängig etwas anderes, bevor Sie ein bezahltes Produkt ausliefern.

Die CPML gilt speziell für die XTTS-v2-Modellgewichte und deren Ausgaben — nicht für den Coqui-TTS-Toolkit-Code, der das Modell ausführt, der separat unter MPL-2.0 lizenziert ist und die kommerzielle Nutzung mit Offenlegungsbedingungen für Toolkit-Änderungen durchaus erlaubt. Dieser Absatz erklärt die allgemeine Form der Lizenz; es ist keine Rechtsberatung — lesen Sie die CPML selbst und konsultieren Sie einen Anwalt vor jeder kommerziellen Bereitstellung.

Welche Lizenz verwendet XTTS v2?

XTTS v2 wird unter der Coqui Public Model License (CPML) 1.0.0 veröffentlicht, einer nicht-kommerziellen Lizenz, die für die Modellgewichte und deren generierte Audio-Ausgaben gilt. Sie erlaubt private, Forschungs- und Hobby-Nutzung, verbietet aber die kommerzielle Nutzung — jedes bezahlte Produkt, SaaS-Tool oder Kundenprodukt — ohne separate Vereinbarung. Dies ist keine Rechtsberatung; lesen Sie die CPML selbst, bevor Sie sie kommerziell nutzen.

Wofür XTTS v2 nicht geeignet ist

XTTS v2 ist ein hochwertiges Voice-Cloning-Modell, keine universell einsetzbare, kommerziell bereitstellbare TTS-Engine. Es ist das falsche Werkzeug für die folgenden Situationen:

  • Jedes kommerzielle Produkt ohne bestätigte Lizenz. Die CPML ist nicht-kommerziell, und derzeit gibt es keinen bestätigten, aktiven Weg zu einer kommerziellen Lizenz nach Coqui AIs Schließung 2023. Liefern Sie XTTS v2 nicht in einem bezahlten Produkt, einer werbefinanzierten App oder einem Kundenprodukt aus, ohne zuvor unabhängig die Lizenzbedingungen zu bestätigen.
  • Reine CPU-Nutzung mit begrenzten Ressourcen in Echtzeit. XTTS v2 unterstützt zwar latenzarmes Streaming, doch diese Leistung setzt GPU-Beschleunigung voraus; auf reiner CPU ist es merklich langsamer als eine leichtgewichtige Engine wie Piper und für den Echtzeit-Einsatz auf bescheidener Hardware wie einem Raspberry Pi möglicherweise nicht praktikabel.
  • Klonen einer Stimme aus sehr kurzem oder verrauschtem Audio. Zwar sind 6 Sekunden das dokumentierte Minimum, doch ein verrauschter, komprimierter oder Multi-Speaker-Referenzclip erzeugt einen merklich schlechteren Klon als eine saubere Einzelsprecher-Aufnahme.
  • Eine Sprache außerhalb der unterstützten 17. XTTS v2 unterstützt genau Englisch, Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch, Polnisch, Türkisch, Russisch, Niederländisch, Tschechisch, Arabisch, Chinesisch (zh-cn), Japanisch, Ungarisch, Koreanisch und Hindi — zum Zeitpunkt der Veröffentlichung gibt es keine offizielle Roadmap für weitere Sprachen.
  • Jemanden ohne Zustimmung imitieren. Das Klonen der Stimme einer echten Person ohne deren Wissen oder Zustimmung wirft Fragen zu Einwilligung, Persönlichkeitsrechten und potenziell Betrug oder Identitätsdiebstahl auf, die unabhängig von der nicht-kommerziellen Einschränkung der CPML bestehen — diese gelten unabhängig von den Lizenzbedingungen, sowohl bei privater als auch bei kommerzieller Nutzung.

Alternativen zu XTTS v2

Piper

Am besten für:
Schnellste reine CPU-Synthese, kein Voice-Cloning, Echtzeit auf einem Raspberry Pi
Lizenz:
GPL-3.0-or-later

Coqui-TTS-Toolkit

Am besten für:
Die Software, die XTTS v2 (und andere Modelle) mit einer breiteren, freizügig lizenzierten Codebasis ausführt
Lizenz:
MPL-2.0 (nur Toolkit)

Bark

Am besten für:
Ausdrucksstarkes, nicht-sprachliches Audio — Lachen, Seufzer, Umgebungsgeräusche
Lizenz:
MIT

StyleTTS 2

Am besten für:
Höchste natürlich klingende englische Narrationsqualität (kein Voice-Cloning)
Lizenz:
MIT

ElevenLabs

Am besten für:
Verwaltete Cloud-API mit kommerziellem Voice-Cloning und klarer kommerzieller Lizenzierung
Lizenz:
Proprietär (kostenpflichtige Cloud-API)

Häufig gestellte Fragen

Was ist XTTS v2?

XTTS v2 ist ein mehrsprachiges Voice-Cloning-Text-zu-Sprache-Modell von Coqui, das eine Stimme aus nur 6 Sekunden Referenzaudio klont und Sprache in dieser Stimme in 17 Sprachen erzeugt, einschließlich sprachübergreifendem Cloning.

Darf ich XTTS v2 kommerziell nutzen?

Nicht ohne separate Vereinbarung. XTTS v2 steht unter der Coqui Public Model License (CPML), die private, Forschungs- und Hobby-Nutzung erlaubt, aber kommerzielle Nutzung verbietet — jedes bezahlte Produkt, SaaS, werbefinanzierte Inhalte oder Kundenarbeit. Coqui AI, das Unternehmen, das es veröffentlichte, stellte seine kostenpflichtigen Dienste im Dezember 2023 ein, und PromptQuorum konnte nicht bestätigen, dass heute ein aktiver kommerzieller Lizenzweg existiert. Behandeln Sie XTTS v2 als ausschließlich nicht-kommerziell.

Wie viel Referenzaudio benötigt XTTS v2 zum Klonen einer Stimme?

Laut offizieller Hugging-Face-Model-Card reichen bereits 6 Sekunden sauberes Einzelsprecher-Referenzaudio. Ein längerer, sauberer Clip erzeugt in der Regel einen genaueren Klon.

Wie viele Sprachen unterstützt XTTS v2?

Genau 17: Englisch, Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch, Polnisch, Türkisch, Russisch, Niederländisch, Tschechisch, Arabisch, Chinesisch (zh-cn), Japanisch, Ungarisch, Koreanisch und Hindi. Es unterstützt sprachübergreifendes Cloning — klonen Sie eine Stimme aus Audio in einer dieser Sprachen und erzeugen Sie Sprache in jeder der anderen.

Wie führe ich XTTS v2 aus?

Installieren Sie das Coqui-TTS-Toolkit mit pip install coqui-tts, laden Sie dann das Modell mit TTS("tts_models/multilingual/multi-dataset/xtts_v2"). Setzen Sie zuerst die Umgebungsvariable COQUI_TOS_AGREED=1, wenn Sie die CPML-Lizenz nicht-interaktiv akzeptieren müssen, etwa in einem Docker-Container oder einer CI-Pipeline.

Benötige ich eine GPU, um XTTS v2 auszuführen?

Eine GPU wird dringend empfohlen. XTTS v2 läuft auf der CPU, aber merklich langsamer — seine dokumentierte Streaming-Latenz unter 200 ms setzt GPU-Beschleunigung voraus, und reine CPU-Nutzung ist für Echtzeitanwendungen nicht praktikabel.

Was ist der Unterschied zwischen XTTS v2 und dem Coqui-TTS-Toolkit?

XTTS v2 ist ein spezifisches Voice-Cloning-Modell, lizenziert unter der nicht-kommerziellen CPML. Das Coqui-TTS-Toolkit ist die Software — ein Python-Paket und eine CLI —, die XTTS v2 und andere Modelle ausführt, separat lizenziert unter MPL-2.0, was die kommerzielle Nutzung des Toolkit-Codes selbst durchaus erlaubt.

Fazit

XTTS v2 bleibt eines der qualitativ hochwertigsten lokal verfügbaren Voice-Cloning-Modelle im Jahr 2026, und die Kombination aus einer 6-Sekunden-Cloning-Anforderung, 17-sprachiger sprachübergreifender Unterstützung und Streaming-Latenz unter 200 ms ist für private Nutzung, Forschung und Prototyping wirklich leistungsfähig. Die Entscheidung, die für die meisten Leser tatsächlich zählt, ist die Lizenz: Die Coqui Public Model License ist eindeutig nicht-kommerziell, und da Coqui AI im Dezember 2023 geschlossen hat, gibt es heute keinen bestätigten aktiven Weg zu einer kommerziellen Lizenz. Wenn Ihr Anwendungsfall privat, akademisch oder ein nicht-kommerzieller Prototyp ist, ist XTTS v2 eine starke, gut dokumentierte Wahl. Wenn Sie kommerzielles Voice-Cloning benötigen, bestätigen Sie die Lizenzbedingungen unabhängig, bevor Sie darauf aufbauen, oder kombinieren Sie diesen Test mit PromptQuorums Abdeckung von Piper und Bark für freizügig lizenzierte Alternativen oder dem ElevenLabs-Vergleich für eine verwaltete kommerzielle Option.

Quellen

← Zurück zu Lokale LLMs Pro