Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/StyleTTS 2 : avis (2026) — le modèle de recherche sous licence MIT de Columbia pour une voix naturelle
Voice, Speech & Multimodal

StyleTTS 2 : avis (2026) — le modèle de recherche sous licence MIT de Columbia pour une voix naturelle

·12 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

StyleTTS 2 est un modèle de synthèse vocale open source, de niveau recherche, de l'université Columbia, qui génère une voix au rendu naturel grâce à la diffusion de style et à un entraînement adversarial avec de grands modèles de langage vocal. Son code est sous licence MIT, installé avec git clone https://github.com/yl4579/StyleTTS2.git && pip install -r requirements.txt. Son README ajoute une condition distincte, hors licence, sur les poids du modèle pré-entraîné (divulguer que la voix est synthétisée sauf autorisation du locuteur), et le dépôt GitHub public n'affiche aucun commit depuis le 7 mars 2024. Pour une comparaison complète des licences des moteurs TTS locaux, consultez le guide des licences TTS locales de PromptQuorum.

StyleTTS 2 est un modèle de synthèse vocale open source publié par des chercheurs de l'université Columbia sur GitHub, qui génère une voix au rendu naturel grâce à la diffusion de style et à un entraînement adversarial avec de grands modèles de langage vocal. Son code est sous licence MIT, mais son README ajoute une condition de divulgation distincte, hors licence, pour les poids du modèle pré-entraîné, et le dépôt public n'a reçu aucun commit depuis le 7 mars 2024. Cet avis couvre ce que fait réellement StyleTTS 2, des commandes d'installation et d'inférence réelles, la nuance de licence entre le code MIT et les poids conditionnels, ainsi que son statut de maintenance dormant mais non archivé — le tableau honnête pour quiconque l'évalue en 2026.

StyleTTS 2 : avis (2026) — le modèle de recherche sous licence MIT de Columbia pour une voix naturelle

Points clés

  • Voix au rendu naturel via diffusion de style et entraînement adversarial, égalant ou dépassant les enregistrements humains sur les benchmarks standard mono-locuteur selon son article NeurIPS.
  • Licence du code : MIT. Les poids du modèle pré-entraîné portent une condition de divulgation distincte dans le README, non codifiée dans le texte de la licence MIT.
  • Transfert de style zero-shot à partir d'un clip de référence de 5 à 10 secondes via le point de contrôle multi-locuteurs LibriTTS (15 à 30 secondes recommandées).
  • L'inférence officielle nécessite espeak-ng sous licence GPL-3.0 ; un paquet pip communautaire l'évite mais sa dernière version date du 11 janvier 2024.
  • Aucun commit sur le dépôt officiel depuis le 7 mars 2024 ; non archivé, plus de 6 300 étoiles GitHub.
  • Les points de contrôle pré-entraînés sont principalement en anglais ; l'aligneur de texte a aussi été entraîné sur des corpus japonais et chinois et généraliserait à d'autres langues sans réglage fin.

📍 En une phrase

StyleTTS 2 est le modèle de synthèse vocale de recherche sous licence MIT de l'université Columbia, qui produit une voix au rendu naturel via diffusion de style et entraînement adversarial, avec une condition de divulgation au niveau de la documentation sur ses poids pré-entraînés et aucun commit GitHub depuis le 7 mars 2024.

💬 En termes simples

C'est un modèle d'IA gratuit et téléchargeable qui transforme du texte en une voix au rendu très naturel, créé par des chercheurs universitaires plutôt que par une entreprise — libre d'utilisation commerciale selon la licence du code, mais ses propres instructions demandent d'informer les auditeurs que la voix est synthétisée, et personne ne semble plus corriger activement les bugs.

📌Remarque: Un ticket GitHub sur le projet (#37) a signalé que l'exigence de divulgation du README pour les modèles pré-entraînés se situe en dehors du fichier de licence MIT lui-même, ce que certains lecteurs trouvent déroutant. Lisez vous-même le fichier LICENSE et la section d'utilisation du modèle du README avant tout déploiement — voir la section Licence et coût ci-dessous.

Histoire : un projet de recherche de Columbia

StyleTTS 2 a été créé par des chercheurs du département de génie électrique de l'université Columbia — Yinghao Aaron Li, Cong Han, Vinay S. Raghavan, Gavin Mischler et Nima Mesgarani — et publié sous forme d'article NeurIPS 2023 intitulé « StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models ».

L'affirmation centrale de l'article est que la combinaison de la diffusion de style (modéliser le style de parole comme une distribution de probabilité latente plutôt qu'un vecteur fixe unique) et d'un entraînement adversarial contre de grands modèles de langage vocal pré-entraînés permet de modéliser la variation humaine de la parole plus précisément que les approches antérieures. Sur le benchmark mono-locuteur LJSpeech, l'article rapporte que StyleTTS 2 égale ou dépasse des enregistrements de voix humaine réelle lors d'évaluations d'auditeurs ; sur le jeu de données multi-locuteurs LibriTTS, il rapporte surpasser les modèles publics précédemment disponibles en adaptation zero-shot au locuteur.

Le dépôt GitHub public yl4579/StyleTTS2 a accumulé plus de 6 300 étoiles, et n'est pas marqué comme archivé — mais PromptQuorum n'a trouvé aucun commit sur la branche principale du dépôt depuis le 7 mars 2024, d'après l'historique public des commits du projet. Cela correspond davantage à une publication de recherche universitaire qu'à un produit open source maintenu commercialement : le code, l'article et les points de contrôle pré-entraînés ont été publiés pour accompagner la recherche, sans engagement continu de développement de fonctionnalités ou de versions correctives.

Un paquet pip maintenu par la communauté, styletts2 du développeur Sidharth Rajaram, encapsule le code de recherche original dans un paquet installable (pip install styletts2) qui remplace le phonémiseur espeak-ng sous licence GPL-3.0 par la bibliothèque gruut sous licence MIT, afin de garder toute la chaîne d'installation sous licence permissive. Sa version la plus récente sur PyPI est la 0.1.6, publiée le 11 janvier 2024 — également vieille de plus de deux ans et demi au moment de cet avis, et un projet tiers distinct du code de recherche original de Columbia.

Qui a créé StyleTTS 2 ?

StyleTTS 2 a été créé par Yinghao Aaron Li, Cong Han, Vinay S. Raghavan, Gavin Mischler et Nima Mesgarani, chercheurs au département de génie électrique de l'université Columbia, et publié sous forme d'article NeurIPS 2023.

Ce que fait réellement StyleTTS 2

StyleTTS 2 est un modèle de synthèse vocale qui génère un mel-spectrogramme (et, dans sa configuration bout en bout, une forme d'onde brute) à partir d'un texte d'entrée, en utilisant un modèle de diffusion pour échantillonner un vecteur de « style » latent plutôt que de devoir le prédire de manière déterministe — ce mécanisme est crédité par l'article d'une prosodie plus naturelle et plus humaine.

  • Diffusion de style pour une prosodie naturelle. Plutôt que de prédire un embedding de style fixe unique à partir du texte, StyleTTS 2 échantillonne, via diffusion, une distribution de probabilité apprise sur les styles, ce qui produirait, selon l'article, une variation plus naturelle du ton, du rythme et de l'emphase que les approches déterministes.
  • Entraînement adversarial contre des modèles de langage vocal. Le processus d'entraînement oppose le modèle TTS à de grands modèles de langage vocal (SLM) pré-entraînés agissant comme discriminateurs, une technique que l'article crédite de combler l'écart restant avec la qualité des enregistrements humains sur le benchmark LJSpeech.
  • Deux points de contrôle pré-entraînés officiellement publiés. StyleTTS2-LJSpeech (locuteur anglais unique, 24 kHz) et StyleTTS2-LibriTTS (multi-locuteurs anglais) sont tous deux hébergés sur Hugging Face.
  • Transfert de style zero-shot à partir d'un audio de référence. Le point de contrôle multi-locuteurs LibriTTS peut synthétiser un nouveau texte dans un style capturé à partir d'un clip audio de référence — la documentation du projet et des guides tiers décrivent un minimum de 5 à 10 secondes, avec 15 à 30 secondes d'audio de référence propre, mono-locuteur, recommandées pour une timbre, une prosodie et une prononciation précises.
  • Points de contrôle pré-entraînés principalement en anglais, avec un travail préparatoire multilingue. Les points de contrôle officiellement publiés sont entraînés sur des jeux de données anglais (LJSpeech, LibriTTS). L'article note que son composant aligneur de texte a également été pré-entraîné sur des corpus japonais (JVS) et chinois (AiShell) et « fonctionne bien pour la plupart des autres langues sans réglage fin », et référence un modèle PL-BERT multilingue couvrant 14 langues comme point de départ pour entraîner soi-même un modèle StyleTTS 2 non anglais — mais il n'existe aucun point de contrôle non anglais officiellement publié et prêt à l'emploi.

Installer et exécuter StyleTTS 2 : étape par étape

Ce guide suit la configuration documentée par le projet lui-même pour l'inférence avec un point de contrôle pré-entraîné.

  1. 1
    Cloner le dépôt et installer les dépendances.
    Why it matters: Exécutez `git clone https://github.com/yl4579/StyleTTS2.git && cd StyleTTS2 && pip install -r requirements.txt`. Cela installe les dépendances Python principales listées dans le fichier requirements du projet.
  2. 2
    Installer le phonémiseur et espeak-ng.
    Why it matters: Exécutez `pip install phonemizer` et, sous Linux, `sudo apt-get install espeak-ng` (ou l'équivalent pour votre système d'exploitation). Notez qu'espeak-ng est lui-même sous licence GPL-3.0 — voir la section Licence et coût pour comprendre pourquoi cela compte pour le chemin d'inférence, pas seulement pour le code de StyleTTS 2 lui-même.
  3. 3
    Télécharger un point de contrôle pré-entraîné.
    Why it matters: Téléchargez [StyleTTS2-LJSpeech](https://huggingface.co/yl4579/StyleTTS2-LJSpeech/tree/main) (locuteur unique) ou [StyleTTS2-LibriTTS](https://huggingface.co/yl4579/StyleTTS2-LibriTTS/tree/main) (multi-locuteurs, prend en charge le transfert de style) depuis Hugging Face dans le répertoire du projet.
  4. 4
    Exécuter l'inférence via les notebooks fournis.
    Why it matters: Le projet fournit `Demo/Inference_LJSpeech.ipynb` et `Demo/Inference_LibriTTS.ipynb` — ouvrez celui qui correspond à votre point de contrôle téléchargé dans Jupyter pour charger le modèle et synthétiser votre premier échantillon.
  5. 5
    (Alternative) Utiliser le paquet pip communautaire pour une chaîne d'installation plus simple, entièrement sous MIT.
    Why it matters: Exécutez `pip install styletts2`, puis `from styletts2 import tts; my_tts = tts.StyleTTS2(); my_tts.inference("Bonjour.", output_wav_file="test.wav")`. Ce paquet tiers (dernière version le 11 janvier 2024) utilise la bibliothèque gruut sous licence MIT au lieu d'espeak-ng, évitant la dépendance GPL-3.0 — au prix de dépendre d'un wrapper non officiel, lui aussi dormant.
  6. 6
    (Optionnel) Fournir un clip de référence pour le transfert de style.
    Why it matters: Avec le point de contrôle LibriTTS, passez un argument `target_voice_path` (paquet communautaire) ou le paramètre audio de référence équivalent (notebook officiel) pointant vers un fichier WAV mono-locuteur propre de 15 à 30 secondes, pour synthétiser un nouveau texte dans ce style capturé.

Exemples d'utilisation réels

Ces exemples montrent à la fois l'API simplifiée du paquet pip communautaire et le schéma utilisé dans les notebooks d'inférence du projet officiel.

  • La qualité de l'audio de référence compte pour le transfert de style. Un clip mono-locuteur propre de 15 à 30 secondes produit un transfert de style nettement meilleur qu'une référence courte, bruitée ou multi-locuteurs.
  • Deux chaînes de dépendances distinctes existent. Le chemin par notebook du dépôt officiel entraîne espeak-ng sous licence GPL-3.0 ; le paquet pip communautaire évite cela avec gruut à la place — choisissez la chaîne qui correspond à vos exigences de licence avant de construire des outils autour de l'une ou l'autre.
python
# Chemin le plus simple : paquet pip communautaire (chaîne de dépendances
# entièrement MIT, dernière version 2024-01-11 — vérifiez avant d'en dépendre)
pip install styletts2

from styletts2 import tts

my_tts = tts.StyleTTS2()
my_tts.inference(
    "Hello there, this is a natural-sounding synthesized sentence.",
    output_wav_file="test.wav",
)

# Transfert de style zero-shot à partir d'un clip de référence (checkpoint type LibriTTS)
my_tts.inference(
    "The same text, now spoken in a captured reference style.",
    target_voice_path="reference_voice.wav",
    output_wav_file="styled_test.wav",
)

# Chemin de checkpoint et de configuration personnalisé
custom_tts = tts.StyleTTS2(
    model_checkpoint_path="/path/to/epochs_2nd_00020.pth",
    config_path="/path/to/config.yml",
)

# --- Chemin du dépôt officiel (nécessite espeak-ng, GPL-3.0) ---
# git clone https://github.com/yl4579/StyleTTS2.git
# cd StyleTTS2 && pip install -r requirements.txt
# pip install phonemizer && sudo apt-get install espeak-ng
# Ouvrez ensuite Demo/Inference_LJSpeech.ipynb ou Demo/Inference_LibriTTS.ipynb
# dans Jupyter et exécutez les cellules fournies avec votre checkpoint téléchargé.

Licence et coût

Le code de StyleTTS 2 est sous licence MIT, confirmé par le fichier LICENSE du dépôt officiel. MIT est une licence permissive : vous pouvez utiliser, modifier et redistribuer le code, y compris commercialement, avec des restrictions minimales.

Les poids du modèle pré-entraîné portent une condition distincte, hors licence, énoncée dans le README, pas dans le fichier LICENSE lui-même. Le README du projet demande aux utilisateurs « d'informer les auditeurs que les échantillons de voix sont synthétisés par les modèles StyleTTS 2, sauf si vous avez la permission d'utiliser la voix que vous synthétisez ». Il s'agit d'une demande au niveau de la documentation, pas d'une clause de licence formelle — un ticket GitHub sur le projet (#37) a explicitement signalé que cela pouvait prêter à confusion, puisque le badge de licence et le fichier LICENSE du dépôt suggèrent à un lecteur qui ne lit pas aussi la section d'utilisation du modèle du README que seules les conditions MIT s'appliquent. PromptQuorum n'a trouvé aucune réponse des mainteneurs résolvant cette ambiguïté dans le fil de discussion public. Traitez la condition de divulgation comme une demande réelle et documentée des auteurs, et respectez-la — mais comprenez qu'elle se situe en dehors de l'octroi MIT formel sur le code lui-même, une structure véritablement inhabituelle à signaler avant toute utilisation commerciale.

L'exécution de l'inférence officielle entraîne une dépendance sous licence GPL-3.0 : espeak-ng. Les instructions d'installation du projet demandent pip install phonemizer plus une installation système d'espeak-ng, et espeak-ng est sous licence GPL-3.0. GPL-3.0 est une licence copyleft avec des obligations de distribution différentes de MIT ; utiliser espeak-ng comme dépendance système externe non modifiée est généralement traité différemment du fait de lier statiquement ou de redistribuer son code source modifié, mais la limite exacte dépend de votre déploiement. Le paquet pip communautaire styletts2 contourne ce problème spécifique en utilisant la bibliothèque gruut sous licence MIT à la place d'espeak-ng — une différence pratique réelle si vous voulez une chaîne de dépendances entièrement permissive, au prix de dépendre d'un paquet tiers dont la dernière version (11 janvier 2024) est encore plus ancienne que celle du dépôt officiel.

Rien de tout cela ne constitue un conseil juridique. Lisez le fichier LICENSE, la section d'utilisation du modèle du README, et consultez un avocat pour votre déploiement spécifique avant de livrer StyleTTS 2 dans un produit commercial.

Quelle licence utilise StyleTTS 2 ?

Le code de StyleTTS 2 est sous licence MIT. Ses poids de modèle pré-entraîné portent une condition distincte, hors licence, énoncée dans le README du projet (divulguer la voix synthétisée sauf autorisation du locuteur), qui ne fait pas partie du texte formel de la licence MIT — une distinction qu'un ticket GitHub sur le projet a signalée comme potentiellement déroutante. Ceci n'est pas un conseil juridique ; lisez vous-même le fichier LICENSE et le README avant toute utilisation commerciale.

Ce pour quoi StyleTTS 2 n'est pas adapté

StyleTTS 2 est un modèle de niveau recherche avec une qualité de sortie véritablement solide, pas un produit grand public abouti et activement maintenu. C'est le mauvais outil pour les situations suivantes :

  • Les lecteurs qui veulent une expérience simple pip-install-et-c'est-parti. Contrairement à Piper, qui n'est qu'à pip install piper-tts et une seule commande CLI d'un audio fonctionnel, le chemin officiel de StyleTTS 2 implique de cloner un dépôt de recherche, d'installer un phonémiseur, une dépendance système espeak-ng, et d'exécuter des notebooks Jupyter — une barrière de configuration nettement plus élevée.
  • Le déploiement en production sans effort d'ingénierie ML. Il n'existe aucun mode serveur web maintenu, aucune image Docker officielle, et aucune entreprise assurant un support continu. Quiconque déploie StyleTTS 2 en production doit s'attendre à écrire et maintenir sa propre couche de service autour du code de recherche.
  • Des corrections de bugs ou mises à jour de fonctionnalités continues garanties. Sans commit sur le dépôt officiel depuis le 7 mars 2024, et avec la dernière version du paquet pip communautaire datée du 11 janvier 2024, ne présumez pas d'une maintenance active pour l'une ou l'autre chaîne de dépendances — prévoyez la possibilité d'être livré à vous-même pour tout problème rencontré.
  • Une voix non anglaise prête à l'emploi. Les points de contrôle pré-entraînés officiellement publiés sont uniquement en anglais (LJSpeech, LibriTTS). Entraîner soi-même un modèle non anglais est architecturalement possible selon les notes de l'article sur son aligneur de texte multilingue et PL-BERT, mais nécessite votre propre entraînement — il n'existe aucun point de contrôle non anglais téléchargeable auprès du projet.
  • Un octroi de licence unique et sans ambiguïté pour tout ce que vous téléchargez. Parce que le code (MIT) et les poids pré-entraînés (MIT plus une condition de divulgation dans le README) sont régis légèrement différemment, et que le chemin d'inférence officiel entraîne une dépendance GPL-3.0, StyleTTS 2 n'offre pas l'histoire de licence unique et simple qu'offre un projet comme Bark (entièrement MIT, sans conditions supplémentaires).

Alternatives à StyleTTS 2

Piper

Meilleur usage:
Configuration simple pip-install-et-c'est-parti, synthèse CPU la plus rapide, temps réel sur Raspberry Pi
Licence:
GPL-3.0-or-later

XTTS v2

Meilleur usage:
Clonage vocal packagé à partir de 6 secondes d'audio de référence, 17 langues
Licence:
CPML (non commercial)

Coqui TTS

Meilleur usage:
Boîte à outils multi-backend flexible avec large support linguistique et fork maintenu
Licence:
MPL-2.0

Bark

Meilleur usage:
Audio expressif non vocal — rires, soupirs, sons ambiants, licence MIT unique et sans ambiguïté
Licence:
MIT

ElevenLabs

Meilleur usage:
API cloud gérée avec clonage vocal commercial et support actif, aucun effort d'auto-hébergement
Licence:
Propriétaire (API cloud payante)

Questions fréquentes

Qu'est-ce que StyleTTS 2 ?

StyleTTS 2 est un modèle de synthèse vocale open source de chercheurs de l'université Columbia, qui génère une voix au rendu naturel via diffusion de style et entraînement adversarial avec de grands modèles de langage vocal, publié sous forme d'article NeurIPS 2023.

StyleTTS 2 est-il libre d'utilisation commerciale ?

Son code est sous licence MIT, qui autorise l'usage commercial. Ses poids de modèle pré-entraîné portent une condition distincte, hors licence, dans le README, demandant de divulguer la voix synthétisée sauf autorisation du locuteur. Ceci n'est pas un conseil juridique ; lisez vous-même le fichier LICENSE et le README avant tout déploiement commercial.

StyleTTS 2 peut-il cloner une voix ?

Son point de contrôle multi-locuteurs LibriTTS prend en charge le transfert de style zero-shot à partir d'un clip audio de référence (5 à 10 secondes minimum, 15 à 30 secondes recommandées), ce qui s'apparente au clonage vocal dans l'esprit. Ce n'est pas proposé comme une fonctionnalité de clonage simple en une ligne comme XTTS v2 — son utilisation nécessite le workflow officiel basé sur notebook ou le paquet pip communautaire.

StyleTTS 2 est-il encore maintenu ?

Le dépôt GitHub officiel n'est pas marqué comme archivé, mais PromptQuorum n'a trouvé aucun commit depuis le 7 mars 2024. Le paquet pip communautaire qui simplifie l'installation a été publié pour la dernière fois le 11 janvier 2024. Traitez les deux comme des artefacts de recherche dormants plutôt que comme des logiciels activement développés.

StyleTTS 2 prend-il en charge d'autres langues que l'anglais ?

Les points de contrôle pré-entraînés officiellement publiés (LJSpeech, LibriTTS) sont uniquement en anglais. L'article note que son composant aligneur de texte a également été entraîné sur des corpus japonais et chinois et généralise raisonnablement à d'autres langues sans réglage fin, et référence un modèle PL-BERT multilingue de 14 langues comme point de départ pour entraîner votre propre modèle non anglais — mais il n'existe aucun point de contrôle non anglais prêt à l'emploi officiellement publié.

Pourquoi l'installation officielle de StyleTTS 2 nécessite-t-elle espeak-ng, et pourquoi est-ce important ?

Le chemin d'inférence officiel utilise la bibliothèque phonemizer avec espeak-ng comme backend pour convertir le texte en phonèmes. espeak-ng est sous licence GPL-3.0, une licence copyleft avec des obligations de distribution différentes de MIT. Un paquet pip communautaire (styletts2) évite cela en utilisant la bibliothèque gruut sous licence MIT à la place, au prix de dépendre d'une version non officielle encore plus ancienne (dernière mise à jour le 11 janvier 2024).

Comment StyleTTS 2 se compare-t-il à XTTS v2 ?

Le code de StyleTTS 2 est sous licence MIT et libre d'usage commercial (avec la condition de divulgation du README sur les poids) ; XTTS v2 est sous la licence non commerciale Coqui Public Model License. La configuration officielle de StyleTTS 2 est plus orientée recherche et demande plus de travail manuel ; XTTS v2 propose une API de clonage vocal plus simple et packagée via la boîte à outils Coqui TTS. Choisissez selon vos besoins de licence et votre tolérance à la complexité de configuration.

Verdict

StyleTTS 2 reste véritablement impressionnant sur la qualité de sortie : son approche par diffusion de style et entraînement adversarial est créditée dans son propre article NeurIPS d'égaler ou dépasser la qualité des enregistrements humains sur le benchmark LJSpeech, sous une licence de code (MIT) aussi permissive que possible. Ce qui l'empêche d'être une recommandation facile pour la plupart des lecteurs, c'est tout ce qui entoure ce modèle central : une condition de divulgation au niveau de la documentation sur les poids pré-entraînés qui se situe en dehors de l'octroi MIT formel, un chemin d'inférence officiel qui entraîne une dépendance GPL-3.0, un paquet pip communautaire qui évite cette dépendance mais qui est lui-même vieux de plus de deux ans et demi, et aucun commit sur le dépôt officiel depuis le 7 mars 2024. Si vous voulez la meilleure qualité de narration anglaise naturelle disponible localement et que vous êtes à l'aise avec une configuration de niveau recherche et une chaîne de dépendances non maintenue, StyleTTS 2 tient ses promesses. Si vous voulez une installation plus simple, une maintenance active, ou un clonage vocal packagé, combinez cet avis avec la couverture de Piper par PromptQuorum pour une synthèse CPU rapide, XTTS v2 pour un clonage vocal packagé, ou la comparaison ElevenLabs pour une alternative entièrement gérée. Cet avis est le dernier des six moteurs locaux de reconnaissance et de synthèse vocale que PromptQuorum a examinés en profondeur, aux côtés de Whisper.cpp, Faster Whisper, Piper, Coqui TTS, XTTS v2 et Bark.

Sources

← Retour aux LLM locaux avancés