Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/XTTS v2 : avis (2026) — clonage vocal multilingue à partir de 6 secondes d'audio
Voice, Speech & Multimodal

XTTS v2 : avis (2026) — clonage vocal multilingue à partir de 6 secondes d'audio

·12 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

XTTS v2 est un modèle de clonage vocal multilingue publié par Coqui qui clone une voix à partir d'à peine 6 secondes d'audio de référence et génère de la parole dans cette voix en 17 langues. Il s'exécute via le kit Coqui TTS (pip install coqui-tts, puis TTS("tts_models/multilingual/multi-dataset/xtts_v2")). Sa licence, la Coqui Public Model License (CPML), est non commerciale — et comme Coqui AI, l'entreprise, a fermé ses services payants en décembre 2023, il n'existe actuellement aucune voie active vers une licence commerciale. Pour une comparaison complète des licences entre moteurs TTS locaux, voir le guide des licences TTS locales de PromptQuorum.

XTTS v2 est un modèle de clonage vocal multilingue publié par Coqui, distribué sur Hugging Face, qui clone une voix à partir d'à peine 6 secondes d'audio de référence et la fait parler dans 17 langues. Il s'exécute via le kit Coqui TTS — le fork activement maintenu est idiap/coqui-ai-TTS — ou peut être utilisé de manière autonome via les poids du modèle. Cet avis couvre ce que fait réellement XTTS v2, des commandes d'utilisation réelles, sa licence (la Coqui Public Model License, CPML, non commerciale) et où il est ou non le bon outil, car Coqui AI, l'entreprise qui l'a publié à l'origine, a fermé ses services payants en décembre 2023.

XTTS v2 : avis (2026) — clonage vocal multilingue à partir de 6 secondes d'audio

Points clés

  • Clone une voix à partir d'à peine 6 secondes d'audio de référence, en 17 langues.
  • S'exécute via le kit Coqui TTS (pip install coqui-tts) ou directement via ses poids de modèle Hugging Face.
  • Licence : Coqui Public Model License (CPML) — non commerciale uniquement.
  • Aucune voie de licence commerciale active : Coqui AI a fermé ses services payants en décembre 2023.
  • Latence de streaming documentée inférieure à 200 ms jusqu'au premier audio ; GPU fortement recommandé.
  • Nécessite d'accepter la CPML — définissez COQUI_TOS_AGREED=1 pour le faire de manière non interactive dans Docker ou CI.

📍 En une phrase

XTTS v2 est le modèle de clonage vocal multilingue de Coqui qui clone une voix à partir de 6 secondes d'audio de référence et la fait parler en 17 langues, sous licence Coqui Public Model License (CPML) non commerciale, sans voie de licence commerciale active depuis que Coqui AI, l'entreprise éditrice, a fermé ses services payants en décembre 2023.

💬 En termes simples

C'est un modèle d'IA qui écoute un court extrait de quelqu'un en train de parler et peut ensuite générer de nouvelles phrases dans cette même voix, en 17 langues différentes — gratuit pour un usage personnel et de recherche, mais pas pour un produit payant sans un accord séparé qui n'existe actuellement pas.

📌Remarque: La CPML n'est pas la même licence que le kit Coqui TTS qui exécute XTTS v2 — le kit est sous MPL-2.0, mais les poids et sorties de ce modèle spécifique sont non commerciaux. Voir la section Licence et usage commercial ci-dessous.

Ce que fait réellement XTTS v2

XTTS v2 est un modèle de synthèse vocale à clonage translingue basé sur GPT. À partir d'un court extrait audio de référence et d'un texte cible, il génère de la parole dans la voix clonée, y compris dans une langue différente de celle de l'audio de référence.

  • Clonage vocal en quelques secondes. Un seul extrait audio de référence de 6 secondes suffit à cloner une voix, selon la fiche modèle officielle de Coqui — aucun fine-tuning ni entraînement n'est requis pour une nouvelle voix.
  • Prise en charge de 17 langues avec clonage translingue. Les langues prises en charge sont l'anglais, l'espagnol, le français, l'allemand, l'italien, le portugais, le polonais, le turc, le russe, le néerlandais, le tchèque, l'arabe, le chinois (zh-cn), le japonais, le hongrois, le coréen et l'hindi — vous pouvez cloner une voix à partir d'un audio en anglais et générer de la parole dans n'importe laquelle des 16 autres langues avec cette même voix clonée.
  • Inférence en streaming. XTTS v2 prend en charge la synthèse en streaming avec une latence inférieure à 200 ms jusqu'au premier audio, documentée depuis l'introduction de cette fonctionnalité dans Coqui TTS v0.20.0 — utile pour les applications vocales interactives où attendre le rendu complet d'un fichier audio est trop lent.
  • S'exécute via le kit Coqui TTS. La principale méthode prise en charge pour exécuter XTTS v2 est via Coqui TTS (pip install coqui-tts), qui l'expose comme TTS("tts_models/multilingual/multi-dataset/xtts_v2").
  • Réutilisation de l'embedding du locuteur. Au-delà du passage d'un extrait de référence brut à chaque fois, le kit prend en charge le calcul et la réutilisation de l'embedding latent d'un locuteur, évitant un recalcul pour des synthèses répétées avec la même voix clonée.

Exemples d'utilisation réels

Ces commandes utilisent l'API Python documentée du kit Coqui TTS, la principale méthode prise en charge pour exécuter XTTS v2.

  • La qualité de l'audio de référence compte. Un extrait propre de 6 secondes d'un seul locuteur sans bruit de fond ni musique produit un clone nettement meilleur qu'un extrait court, bruyant ou multi-locuteurs.
  • L'acceptation non interactive de la CPML est requise la première fois que XTTS v2 se charge dans un environnement sans surveillance (Docker, CI) — définissez COQUI_TOS_AGREED=1 avant ce premier chargement.
python
# Installer le kit
pip install coqui-tts

# Accepter la CPML de manière non interactive (requis pour Docker/CI ;
# sinon une invite interactive apparaît au premier chargement)
export COQUI_TOS_AGREED=1

# API Python : cloner une voix et générer de la parole
import torch
from TTS.api import TTS

device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)

# Clonage dans la même langue
tts.tts_to_file(
    text="This is a cloned voice speaking a new sentence.",
    speaker_wav="reference_voice.wav",
    language="en",
    file_path="output_en.wav",
)

# Clonage translingue : cloner à partir d'un audio anglais, parler en espagnol
tts.tts_to_file(
    text="Esta es la misma voz clonada, ahora hablando en español.",
    speaker_wav="reference_voice.wav",
    language="es",
    file_path="output_es.wav",
)

# Synthèse en streaming (faible latence jusqu'au premier audio)
for chunk in tts.tts_stream(
    text="Streaming audio, chunk by chunk, for interactive use.",
    speaker_wav="reference_voice.wav",
    language="en",
):
    play_audio(chunk)

Licence et usage commercial

Les poids du modèle XTTS v2 et les sorties audio générées sont sous licence Coqui Public Model License (CPML) 1.0.0, confirmée via le fichier de licence publié avec le modèle sur Hugging Face. La CPML précise explicitement qu'elle « n'autorise qu'un usage non commercial d'un modèle d'apprentissage automatique et de ses sorties » — les usages autorisés incluent les projets personnels, la recherche académique et le travail amateur, tant que vous ne recevez aucun paiement direct ou indirect lié à cet usage.

Il n'existe actuellement aucune voie de licence commerciale active pour XTTS v2. La fiche modèle indique une adresse de contact, info@coqui.ai, pour les demandes de licence commerciale, mais Coqui AI, l'entreprise, a fermé ses services payants en décembre 2023 — PromptQuorum n'a pas pu confirmer que cette adresse est activement suivie ou qu'une licence commerciale est obtenable aujourd'hui. Traitez XTTS v2 comme non commercial uniquement, sauf confirmation indépendante contraire avant de lancer un produit payant.

La CPML s'applique spécifiquement aux poids du modèle XTTS v2 et à leurs sorties — pas au code du kit Coqui TTS qui exécute le modèle, qui est sous licence distincte MPL-2.0 et autorise bien l'usage commercial avec des conditions de divulgation de code sur les modifications du kit. Ce paragraphe explique la forme générale de la licence ; ce n'est pas un conseil juridique — lisez la CPML vous-même et consultez un avocat avant tout déploiement commercial.

Quelle licence utilise XTTS v2 ?

XTTS v2 est publié sous la Coqui Public Model License (CPML) 1.0.0, une licence non commerciale qui s'applique aux poids du modèle et à leurs sorties audio générées. Elle autorise l'usage personnel, de recherche et amateur, mais interdit l'usage commercial — tout produit payant, outil SaaS ou livrable client — sans accord séparé. Ceci n'est pas un conseil juridique ; lisez la CPML vous-même avant tout usage commercial.

Pour quoi XTTS v2 n'est pas adapté

XTTS v2 est un modèle de clonage vocal de haute qualité, pas un moteur TTS polyvalent et déployable commercialement. C'est le mauvais outil pour les situations suivantes :

  • Tout produit commercial sans licence confirmée. La CPML est non commerciale, et il n'existe actuellement aucune voie confirmée et active vers une licence commerciale depuis la fermeture de Coqui AI en 2023. Ne déployez pas XTTS v2 dans un produit payant, une application financée par la publicité ou un livrable client sans confirmer au préalable et de manière indépendante les conditions de licence.
  • Usage en temps réel avec des ressources limitées, CPU seul. XTTS v2 prend en charge le streaming à faible latence, mais cette performance suppose une accélération GPU ; sur CPU seul, il est nettement plus lent qu'un moteur léger comme Piper, et peut ne pas être pratique pour un usage en temps réel sur du matériel modeste comme un Raspberry Pi.
  • Cloner une voix à partir d'un audio très court ou bruyant. Bien que 6 secondes soit le minimum documenté, un extrait de référence bruyant, compressé ou multi-locuteurs produit un clone nettement moins bon qu'un enregistrement propre d'un seul locuteur.
  • Une langue en dehors des 17 prises en charge. XTTS v2 prend en charge exactement l'anglais, l'espagnol, le français, l'allemand, l'italien, le portugais, le polonais, le turc, le russe, le néerlandais, le tchèque, l'arabe, le chinois (zh-cn), le japonais, le hongrois, le coréen et l'hindi — il n'y a aucune feuille de route officielle pour d'autres langues à la date de publication.
  • Usurper l'identité de quelqu'un sans consentement. Cloner la voix d'une personne réelle sans son consentement soulève des questions de consentement, de droit à l'image et potentiellement de fraude ou d'usurpation d'identité qui sont indépendantes de la restriction non commerciale de la CPML — elles s'appliquent quelles que soient les conditions de licence, aussi bien en usage personnel que commercial.

Alternatives à XTTS v2

Piper

Meilleur usage:
Synthèse CPU seule la plus rapide, pas de clonage vocal, temps réel sur un Raspberry Pi
Licence:
GPL-3.0-or-later

Kit Coqui TTS

Meilleur usage:
Le logiciel qui exécute XTTS v2 (et d'autres modèles) avec une base de code plus large et sous licence permissive
Licence:
MPL-2.0 (kit uniquement)

Bark

Meilleur usage:
Audio non vocal expressif — rires, soupirs, sons ambiants
Licence:
MIT

StyleTTS 2

Meilleur usage:
Meilleure qualité de narration anglaise naturelle (sans clonage vocal)
Licence:
MIT

ElevenLabs

Meilleur usage:
API cloud gérée avec clonage vocal commercial et licence commerciale claire
Licence:
Propriétaire (API cloud payante)

Questions fréquentes

Qu'est-ce que XTTS v2 ?

XTTS v2 est un modèle de synthèse vocale à clonage multilingue publié par Coqui qui clone une voix à partir d'à peine 6 secondes d'audio de référence et génère de la parole dans cette voix en 17 langues, y compris le clonage translingue.

Puis-je utiliser XTTS v2 commercialement ?

Pas sans accord séparé. XTTS v2 est sous licence Coqui Public Model License (CPML), qui autorise l'usage personnel, de recherche et amateur mais interdit l'usage commercial — tout produit payant, SaaS, contenu financé par la publicité ou travail client. Coqui AI, l'entreprise qui l'a publié, a fermé ses services payants en décembre 2023, et PromptQuorum n'a pas pu confirmer qu'une voie de licence commerciale active existe aujourd'hui. Traitez XTTS v2 comme non commercial uniquement.

Combien d'audio de référence XTTS v2 nécessite-t-il pour cloner une voix ?

À peine 6 secondes d'audio de référence propre d'un seul locuteur, selon sa fiche modèle officielle sur Hugging Face. Un extrait plus long et plus propre produit généralement un clone plus précis.

Combien de langues XTTS v2 prend-il en charge ?

Exactement 17 : anglais, espagnol, français, allemand, italien, portugais, polonais, turc, russe, néerlandais, tchèque, arabe, chinois (zh-cn), japonais, hongrois, coréen et hindi. Il prend en charge le clonage translingue — clonez une voix à partir d'un audio dans l'une de ces langues et générez de la parole dans n'importe laquelle des autres.

Comment exécuter XTTS v2 ?

Installez le kit Coqui TTS avec pip install coqui-tts, puis chargez le modèle avec TTS("tts_models/multilingual/multi-dataset/xtts_v2"). Définissez d'abord la variable d'environnement COQUI_TOS_AGREED=1 si vous devez accepter la licence CPML de manière non interactive, par exemple dans un conteneur Docker ou un pipeline CI.

Ai-je besoin d'un GPU pour exécuter XTTS v2 ?

Un GPU est fortement recommandé. XTTS v2 s'exécute sur CPU, mais nettement plus lentement — sa latence de streaming documentée inférieure à 200 ms suppose une accélération GPU, et l'usage CPU seul n'est pas pratique pour les applications en temps réel.

Quelle est la différence entre XTTS v2 et le kit Coqui TTS ?

XTTS v2 est un modèle de clonage vocal spécifique, sous licence CPML non commerciale. Le kit Coqui TTS est le logiciel — un package Python et une CLI — qui exécute XTTS v2 et d'autres modèles, sous licence distincte MPL-2.0, qui autorise bien l'usage commercial du code du kit lui-même.

Verdict

XTTS v2 reste l'un des modèles de clonage vocal locaux de la plus haute qualité disponibles en 2026, et la combinaison d'une exigence de clonage de 6 secondes, d'une prise en charge translingue en 17 langues et d'une latence de streaming inférieure à 200 ms est réellement performante pour un usage personnel, de recherche et de prototypage. La décision qui compte réellement pour la plupart des lecteurs est la licence : la Coqui Public Model License est sans ambiguïté non commerciale, et avec la fermeture de Coqui AI en décembre 2023, il n'existe aujourd'hui aucune voie active confirmée vers une licence commerciale. Si votre cas d'usage est personnel, académique ou un prototype non commercial, XTTS v2 est un choix solide et bien documenté. Si vous avez besoin de clonage vocal commercial, vérifiez les conditions de licence de manière indépendante avant de construire dessus, ou combinez cet avis avec la couverture par PromptQuorum de Piper et Bark pour des alternatives sous licence permissive, ou la comparaison ElevenLabs pour une option commerciale gérée.

Sources

← Retour aux LLM locaux avancés