Points clés
- Descend du projet de recherche TTS de Mozilla ; développé par la start-up Coqui AI, fondée en 2021 par d'anciens ingénieurs de Mozilla TTS.
- Coqui AI a fermé ses services cloud payants en décembre 2023 ; le dépôt GitHub d'origine coqui-ai/TTS n'a reçu aucun nouveau commit depuis août 2024.
- Fork activement maintenu : idiap/coqui-ai-TTS, par l'Institut de recherche Idiap, publié sur PyPI sous le nom
coqui-tts. - Licence : MPL-2.0 pour le kit. Le modèle XTTS v2 qu'il peut exécuter est sous une licence distincte, la CPML non commerciale — ne pas confondre les deux.
- Gratuit, aucune offre payante ; fonctionne sur CPU, avec GPU recommandé pour les modèles de clonage vocal plus lourds.
- Dernière version du package : coqui-tts v0.27.5, publiée le 26 janvier 2026.
📍 En une phrase
Coqui TTS est un kit open source de synthèse vocale et de clonage de voix en local, descendant du projet TTS de Mozilla, dont l'entreprise d'origine, Coqui AI, a fermé ses services payants en décembre 2023, laissant le dépôt d'origine sans maintenance depuis août 2024 — mais un fork communautaire activement maintenu, idiap/coqui-ai-TTS, poursuit le développement sous l'Institut de recherche Idiap.
💬 En termes simples
C'est un programme que vous installez via pip install et qui peut transformer du texte en parole grâce à plusieurs modèles d'IA différents, dont un modèle de clonage vocal appelé XTTS v2 — l'entreprise qui l'a créé a fermé, mais un institut de recherche maintient aujourd'hui le logiciel à jour.
📌Remarque: Installez coqui-tts (le fork maintenu), pas l'ancien nom de package TTS du dépôt coqui-ai/TTS désormais sans maintenance, si vous voulez une version qui reçoit des mises à jour. Voir la section Installer et exécuter ci-dessous.
Histoire : de Mozilla TTS à un fork communautaire
**Coqui TTS remonte au projet TTS de Mozilla**, un effort de recherche interne de Mozilla sur la technologie vocale open source. Quand Mozilla a dissous ce groupe de recherche en 2021, plusieurs de ses ingénieurs — dont Eren Gölge, Kelly Davis, Josh Meyer et Reuben Morais — ont fondé la start-up Coqui AI pour poursuivre le travail en tant qu'entreprise indépendante, publiant à la fois un kit de synthèse vocale (Coqui TTS) et un kit de reconnaissance vocale (Coqui STT).
Coqui AI a levé 3,3 millions de dollars en amorçage en mars 2023 et proposait à la fois un kit open source et des services cloud payants, incluant un accès hébergé à son modèle de clonage vocal, XTTS. L'entreprise n'a pas trouvé de modèle économique viable au-dessus d'un logiciel open source, et a annoncé la fermeture de ses services payants en décembre 2023, ses serveurs passant hors ligne le 11 décembre 2023.
**Le dépôt d'origine, coqui-ai/TTS, reste publiquement disponible sur GitHub** sous sa licence MPL-2.0, mais n'a reçu aucun nouveau commit depuis août 2024, et GitHub ne l'affiche pas comme formellement archivé — en pratique, il ne reçoit aucun développement actif ni correction de bug.
**Un fork communautaire, idiap/coqui-ai-TTS, poursuit le développement.** Il est maintenu par l'Institut de recherche Idiap, un institut de recherche suisse, et publié sur PyPI sous le nom de package coqui-tts (distinct du nom de package d'origine TTS). Son README indique explicitement qu'il s'agit d'un « fork du dépôt d'origine, non maintenu », et son historique de versions montre des mises à jour continues, dont une version v0.27.0 ajoutant un cache de clonage vocal et une version v0.27.5 le 26 janvier 2026.
Qui a créé Coqui TTS ?
Coqui TTS a été créé par la start-up Coqui AI, fondée en 2021 par d'anciens ingénieurs du projet de recherche TTS de Mozilla, dont Eren Gölge, Kelly Davis, Josh Meyer et Reuben Morais. Après la fermeture des services payants de Coqui AI en décembre 2023, le développement s'est poursuivi sur un fork communautaire maintenu par l'Institut de recherche Idiap.
Ce que fait réellement Coqui TTS
Coqui TTS est un kit, pas un modèle unique — il fournit une interface Python unifiée, une CLI et un pipeline d'entraînement pour exécuter (et, historiquement, entraîner) plusieurs architectures de modèles de synthèse vocale différentes.
- Interface multi-modèles. Une seule classe Python
TTS()charge et exécute différentes architectures de modèles, dont des modèles VITS mono- et multi-locuteurs, des modèles basés sur Tacotron2 et le modèle de clonage vocal XTTS v2, sans changer le code applicatif environnant. - Synthèse en ligne de commande. La commande CLI
ttssynthétise la parole directement depuis le terminal, listant tous les modèles préentraînés disponibles avectts --list_models. - Clonage vocal via XTTS v2. Passer un argument
speaker_wavà un modèle XTTS v2 chargé clone une voix à partir d'un court extrait audio de référence, générant la parole dans cette voix clonée dans les langues prises en charge par XTTS v2. - Large bibliothèque de modèles préentraînés. Le kit donne accès à des modèles préentraînés couvrant, selon sa documentation, plus de 1 100 langues via les modèles massivement multilingues basés sur Fairseq, en plus de modèles curatés de meilleure qualité pour des langues spécifiques.
- Entraînement et fine-tuning de modèles. Au-delà de l'exécution de modèles préentraînés, le kit inclut des scripts d'entraînement et des outils d'analyse de jeux de données pour construire ou affiner un modèle vocal personnalisé — historiquement l'une de ses fonctions les plus utilisées avant la fermeture du service d'entraînement hébergé de Coqui AI.
- Inférence en streaming pour XTTS v2. Le kit documente une synthèse en streaming à faible latence avec XTTS v2 (citée par la documentation du fork maintenu comme une latence inférieure à 200 ms jusqu'au premier audio), utile pour les applications vocales interactives.
Coqui TTS et XTTS v2 : le rapport entre les deux
Coqui TTS (le kit) et XTTS v2 (le modèle) sont deux choses distinctes avec deux licences distinctes, et les confondre est une erreur de licence courante. Le kit Coqui TTS — le package Python, la CLI et le code d'entraînement — est sous licence MPL-2.0, une licence permissive qui autorise l'usage commercial avec des conditions de divulgation de code sur les modifications du kit. XTTS v2 est un modèle préentraîné spécifique dont les poids sont distribués sous la Coqui Public Model License (CPML), une licence non commerciale, distincte de la licence MPL-2.0 du kit.
En pratique, cela signifie que vous pouvez utiliser le kit Coqui TTS commercialement avec des modèles sous licence permissive (modèles VITS ou Tacotron2 entraînés sous des licences compatibles), tandis que la combinaison spécifique « kit Coqui TTS exécutant le modèle XTTS v2 » hérite de la restriction non commerciale de XTTS v2 pour les poids et sorties de ce modèle. Exécuter un modèle différent, sous licence permissive, via le même kit ne porte pas cette restriction.
**Le package coqui-tts documente directement l'utilisation de XTTS v2**, le modèle étant chargé comme TTS("tts_models/multilingual/multi-dataset/xtts_v2"), car le kit est le principal moyen pris en charge pour exécuter XTTS v2 en dehors d'une utilisation directe des poids du modèle via une autre pile d'inférence. Voir l'avis dédié à XTTS v2 de PromptQuorum pour une analyse complète de la licence et des capacités de ce modèle.
Installer et exécuter Coqui TTS : étape par étape
Ce guide installe le package coqui-tts activement maintenu et exécute une première synthèse, selon la syntaxe documentée dans le README du fork maintenu.
- 1Installer le package maintenu.
Why it matters: Exécutez `pip install coqui-tts` (ou `uv pip install coqui-tts` avec uv) dans un environnement Python. Installez spécifiquement le package `coqui-tts` — pas l'ancien nom de package `TTS`, qui pointe vers le dépôt d'origine désormais sans maintenance. - 2Lister les modèles préentraînés disponibles.
Why it matters: Exécutez `tts --list_models` pour voir le catalogue complet des modèles préentraînés disponibles au téléchargement, organisés par langue et architecture (VITS, Tacotron2, XTTS et autres). - 3Synthétiser la parole en ligne de commande.
Why it matters: Exécutez `tts --text "Hello world" --out_path output.wav` pour synthétiser avec le modèle par défaut, ou ajoutez `--model_name <modèle>` pour en choisir un spécifique dans la liste. - 4(Optionnel) Utiliser l'API Python pour le clonage vocal XTTS v2.
Why it matters: Chargez le modèle avec `TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)`, puis appelez `.tts_to_file()` avec un argument `speaker_wav` pointant vers un court extrait audio de référence et un argument `language` pour cloner une voix. - 5(Optionnel) Activer l'accélération GPU.
Why it matters: Passez `gpu=True` au constructeur `TTS()`, ou appelez `.to("cuda")` sur l'objet modèle chargé, pour exécuter l'inférence sur un GPU NVIDIA — recommandé pour XTTS v2, nettement plus lent sur CPU seul. - 6(Optionnel) Accepter la licence CPML de manière non interactive pour XTTS v2.
Why it matters: Le premier chargement de XTTS v2 déclenche une étape interactive d'acceptation de la CPML. Définissez la variable d'environnement `COQUI_TOS_AGREED=1` pour l'accepter de manière non interactive, requis pour un usage sans surveillance dans des conteneurs Docker ou des pipelines CI.
Exemples d'utilisation réels
Au-delà du guide d'installation de base ci-dessus, voici des schémas d'utilisation courants issus de la documentation du fork maintenu.
- Acceptation non interactive de la CPML pour les environnements automatisés : définissez
COQUI_TOS_AGREED=1avant le premier chargement de XTTS v2, pour que les builds Docker et les pipelines CI ne restent pas bloqués sur une invite interactive. - Introspection des locuteurs et langues : après le chargement d'un modèle multi-locuteurs ou multilingue,
tts.speakersettts.languageslistent ce que le modèle chargé prend réellement en charge — utile pour valider les entrées avant la synthèse.
# Ligne de commande : lister les modèles préentraînés disponibles
tts --list_models
# Ligne de commande : synthétiser avec le modèle par défaut
tts --text "Hello world" --out_path output.wav
# Ligne de commande : synthétiser avec un modèle spécifique
tts --model_name "tts_models/en/ljspeech/tacotron2-DDC" \
--text "This is a test." --out_path output.wav
# API Python : synthèse de base
from TTS.api import TTS
tts = TTS("tts_models/en/ljspeech/tacotron2-DDC")
tts.tts_to_file(text="Hello world", file_path="output.wav")
# API Python : clonage vocal XTTS v2 (accepter la CPML de manière non interactive d'abord)
# export COQUI_TOS_AGREED=1
import torch
from TTS.api import TTS
device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)
tts.tts_to_file(
text="Hola, esto es una prueba.",
speaker_wav="reference_voice.wav",
language="es",
file_path="cloned_output.wav",
)
# API Python : lister les locuteurs et langues disponibles sur un modèle chargé
print(tts.speakers)
print(tts.languages)Licence et coût
Le kit Coqui TTS est sous licence MPL-2.0 (Mozilla Public License 2.0), confirmée via les métadonnées publiées du package coqui-tts sur PyPI et le fichier de licence du dépôt idiap/coqui-ai-TTS. La MPL-2.0 est une licence permissive avec conditions : vous pouvez utiliser le kit commercialement, mais si vous modifiez et distribuez les fichiers source propres du kit, vous devez publier ces fichiers modifiés spécifiques sous MPL-2.0 également. Utiliser le kit comme dépendance non modifiée ne place pas votre propre code applicatif sous MPL-2.0.
Le modèle XTTS v2 est sous licence distincte, la Coqui Public Model License (CPML), non commerciale — cela s'applique aux poids du modèle et à leurs sorties audio générées, pas au code du kit Coqui TTS qui les exécute. Voir l'avis XTTS v2 de PromptQuorum pour l'analyse complète de cette licence.
Il n'y a aucune offre payante, abonnement ou redevance de licence pour le kit Coqui TTS lui-même. Les services hébergés payants de Coqui AI ont fermé en décembre 2023 et ne sont disponibles à aucun prix ; la seule façon d'utiliser Coqui TTS aujourd'hui est en auto-hébergement, avec soit le package d'origine non maintenu, soit le fork coqui-tts activement maintenu.
Quelle licence utilise Coqui TTS ?
Le kit Coqui TTS lui-même est sous licence MPL-2.0, qui autorise l'usage commercial à condition que les modifications aux fichiers source propres du kit soient publiées sous la même licence. Ceci est distinct de la licence de tout modèle spécifique qu'il exécute — le modèle XTTS v2, par exemple, est sous la Coqui Public Model License (CPML) non commerciale, qui s'applique aux poids et sorties du modèle, pas au code du kit.
Pour quoi Coqui TTS n'est pas adapté
Coqui TTS est un kit flexible multi-modèles, pas l'option la plus rapide ou la plus simple pour chaque cas d'usage. C'est le mauvais outil pour les situations suivantes :
- Construire sur le dépôt d'origine non maintenu. Si vous exécutez
pip install TTS(l'ancien nom de package) plutôt quepip install coqui-tts(le fork maintenu), vous construisez sur du code qui n'a reçu aucune mise à jour depuis août 2024 — vérifiez quel package un tutoriel ou une dépendance référence réellement avant de vous y fier. - Synthèse CPU seule la plus rapide possible. Si votre priorité est la parole en temps réel sur du matériel modeste comme un Raspberry Pi sans GPU, Piper est conçu spécifiquement pour cela et plus simple à déployer ; les modèles plus lourds de Coqui TTS, en particulier XTTS v2, sont nettement plus lents sur CPU seul.
- Clonage vocal commercial sans vérification de licence séparée. Exécuter XTTS v2 via le kit Coqui TTS porte toujours la restriction non commerciale propre à XTTS v2 (CPML) sur les poids et sorties du modèle — la licence MPL-2.0 du kit ne l'annule pas. Voir la section Licence et coût ci-dessus.
- Support d'entreprise garanti à long terme. L'entreprise Coqui AI n'existe plus depuis décembre 2023. Le fork actuel est maintenu par un institut de recherche sur une base communautaire, un modèle de maintenance différent d'une entreprise financée avec un contrat de support — à prendre en compte pour des décisions d'infrastructure de production critique.
- Une API unique et stable à travers les versions. Comme le développement s'est déplacé entre un original non maintenu et un fork activement développé, certains tutoriels, réponses Stack Overflow et articles de blog en ligne référencent une surface d'API plus ancienne ou l'ancien nom de package — vérifiez par rapport à la documentation actuelle de
coqui-ttsplutôt qu'à un ancien résultat de recherche.
Alternatives à Coqui TTS
Piper
- Meilleur usage:
- Synthèse CPU seule la plus rapide, pas de clonage vocal, temps réel sur un Raspberry Pi
- Licence:
- GPL-3.0-or-later
XTTS v2
- Meilleur usage:
- Le modèle de clonage vocal lui-même, si vous avez besoin uniquement de XTTS v2 et non du kit plus large
- Licence:
- CPML (non commerciale)
Bark
- Meilleur usage:
- Audio non vocal expressif — rires, soupirs, sons ambiants
- Licence:
- MIT
StyleTTS 2
- Meilleur usage:
- Meilleure qualité de narration anglaise naturelle (sans clonage vocal)
- Licence:
- MIT
ElevenLabs
- Meilleur usage:
- API cloud gérée pour les équipes préférant ne pas s'auto-héberger, avec clonage vocal commercial
- Licence:
- Propriétaire (API cloud payante)
Questions fréquentes
Qu'est-ce que Coqui TTS ?
Coqui TTS est un kit open source de synthèse vocale et de clonage de voix en local, descendant du projet de recherche TTS de Mozilla, créé à l'origine par la start-up Coqui AI. Il prend en charge plusieurs architectures de modèles, dont le modèle de clonage vocal XTTS v2, via une interface Python et une CLI uniques.
Coqui TTS est-il encore maintenu ?
Le dépôt d'origine coqui-ai/TTS n'est plus activement maintenu — il n'a reçu aucun nouveau commit depuis août 2024, après que l'entreprise Coqui AI a fermé ses services payants en décembre 2023. Un fork communautaire activement maintenu, idiap/coqui-ai-TTS, poursuit le développement sous l'Institut de recherche Idiap et est publié sur PyPI sous le nom coqui-tts, avec des versions aussi récentes que janvier 2026.
Coqui TTS est-il gratuit ?
Oui, le kit lui-même n'a aucune offre payante ni redevance de licence. Les anciens services hébergés payants de Coqui AI ont fermé en décembre 2023 et ne sont disponibles à aucun prix. Certains modèles spécifiques exécutés sur le kit, comme XTTS v2, ont leur propre licence distincte (CPML) qui restreint l'usage commercial des poids et sorties de ce modèle.
Quelle est la différence entre les packages coqui-tts et TTS ?
TTS est le nom de package PyPI d'origine, lié au dépôt coqui-ai/TTS non maintenu sans mise à jour depuis août 2024. coqui-tts est le nom de package du fork activement maintenu, publié depuis le dépôt idiap/coqui-ai-TTS sous l'Institut de recherche Idiap, avec des versions régulières incluant v0.27.5 en janvier 2026. Installez coqui-tts pour une version qui reçoit des mises à jour.
Coqui TTS prend-il en charge le clonage vocal ?
Oui, via le modèle XTTS v2, que le kit peut charger et exécuter. XTTS v2 clone une voix à partir d'un court extrait audio de référence passé comme argument speaker_wav. Notez que la propre licence de XTTS v2, la Coqui Public Model License (CPML), est non commerciale, distincte de la licence MPL-2.0 du kit.
Pourquoi Coqui AI a-t-il fermé ?
Coqui AI, l'entreprise derrière Coqui TTS, a annoncé la fermeture de ses services hébergés payants en décembre 2023, ses serveurs passant hors ligne le 11 décembre 2023, après avoir peiné à construire un modèle économique viable au-dessus d'une technologie vocale open source. Le kit open source lui-même est resté disponible, et le développement s'est ensuite poursuivi sur un fork communautaire.
Quelle est la dernière version de Coqui TTS ?
La dernière version du package coqui-tts activement maintenu est v0.27.5, publiée le 26 janvier 2026, selon son entrée PyPI.
Verdict
Coqui TTS est une étude de cas réellement utile sur ce qui arrive à une infrastructure open source après la fermeture de l'entreprise qui la porte : le dépôt d'origine s'est tu en août 2024, mais le logiciel n'a pas disparu — un institut de recherche a repris la maintenance, renommé le package et continué à publier des versions jusqu'en 2026. Pour quiconque l'évalue aujourd'hui, la conclusion pratique est simple : installez coqui-tts, pas l'ancien package TTS, et comprenez que la licence MPL-2.0 du kit est distincte de la licence non commerciale CPML du modèle XTTS v2 qu'il peut exécuter. En tant que kit, sa force réside dans la flexibilité entre architectures de modèles plutôt que dans le fait d'être l'option la plus rapide ou la plus simple pour un cas d'usage donné — pour cela, combinez cet avis avec la couverture par PromptQuorum de Piper pour la vitesse, XTTS v2 pour le modèle de clonage spécifiquement, ou le guide des licences TTS locales pour la vue d'ensemble sur tous les moteurs.
Sources
- idiap/coqui-ai-TTS sur GitHub — le fork activement maintenu : README, documentation, licence et historique des versions.
- coqui-tts sur PyPI — métadonnées de package publiées, dont la licence MPL-2.0 actuelle et l'historique des versions.
- coqui-ai/TTS sur GitHub — le dépôt d'origine, désormais non maintenu (licence MPL-2.0).
- XTTS v2 sur Hugging Face — la fiche modèle et le texte de licence CPML du modèle de clonage vocal.
- Institut de recherche Idiap — l'institut de recherche suisse qui maintient le fork communautaire.
