Points clés
- XTTS v2 : meilleure qualité de clonage (extrait de référence de 6 secondes, 17 langues), 4-6 Go de VRAM recommandés, licence CPML non commerciale.
- Chatterbox : clonage conversationnel en temps réel, petit modèle ~0,5 Md de paramètres, licence MIT (usage commercial possible).
- Bark : sons expressifs non vocaux, pas de clonage vocal, empreinte VRAM la plus lourde des quatre, licence MIT, maintenance incertaine.
- Kokoro : 82 M de paramètres, Apache 2.0, fonctionne bien sur CPU seul — le contre-exemple sans GPU obligatoire.
- Les trois moteurs orientés GPU tournent sur CPU, mais avec un vrai coût de vitesse — cet écart est la raison même de posséder un GPU pour cet usage.
- Le clonage vocal nécessite le consentement de la personne clonée, quel que soit le moteur ou la licence utilisés.
📍 En une phrase
Sur un GPU NVIDIA, XTTS v2 offre la meilleure qualité de clonage vocal, Chatterbox le meilleur clonage conversationnel en temps réel sous licence MIT commercialement viable, Bark l'audio non vocal le plus expressif, et Kokoro reste le bon choix quand un GPU n'est pas vraiment nécessaire.
💬 En termes simples
Si vous possédez une carte graphique capable de faire tourner des charges de travail IA, trois moteurs de synthèse vocale (XTTS v2, Chatterbox, Bark) en deviennent vraiment plus rapides et meilleurs, tandis qu'un quatrième (Kokoro) n'en a presque pas besoin — le choix dépend de votre besoin de clonage vocal, de votre mémoire vidéo disponible et d'un usage commercial ou non.
📌Remarque: Ce guide suppose que vous possédez déjà un GPU NVIDIA et cherchez quoi y faire tourner. Pour une configuration uniquement CPU (Raspberry Pi, pas de GPU dédié), Piper est le choix standard — voir le comparatif complet de PromptQuorum sur les licences et le VRAM de tous les moteurs TTS locaux, lié dans Lectures complémentaires.
Quels moteurs ont vraiment besoin d'un GPU ?
XTTS v2, Chatterbox et Bark fonctionnent tous sur CPU, mais c'est un GPU qui les rend praticables en temps réel ou en traitement par lots — Kokoro fait exception, ses 82 millions de paramètres le rendant rapide sur CPU seul. Les trois moteurs plus lourds partagent une caractéristique commune : ce sont des modèles privilégiant la qualité de clonage ou de génération, dont l'architecture échange du calcul contre de l'expressivité, si bien que l'accélération CUDA supprime le goulot d'étranglement plutôt que d'apporter un simple gain marginal.
Utilisez un moteur orienté GPU (XTTS v2, Chatterbox ou Bark) si votre usage est le clonage vocal, l'audio expressif non vocal, ou toute charge où la vitesse de génération compte — un lot de narration, une application vocale interactive, ou un pipeline générant de nombreux clips. Évitez de consacrer du VRAM GPU au TTS si votre seul besoin est la narration simple d'un texte brut sans clonage : Kokoro ou Piper couvrent ce cas sur CPU seul, libérant votre VRAM pour un LLM ou une autre tâche en parallèle.
- XTTS v2 fonctionne sur CPU mais y est documenté comme nettement plus lent — sa latence de streaming inférieure à 200 ms est une valeur accélérée par GPU, pas une valeur CPU.
- Chatterbox propose une variante Nano compatible CPU (110 M de paramètres) que la documentation de Resemble AI décrit comme plus rapide que le temps réel sur 8 cœurs CPU, mais les variantes plus grandes orientées clonage profitent de CUDA pour un usage conversationnel en temps réel.
- Bark indique explicitement dans sa propre documentation que l'inférence sur CPU ou GPU anciens peut être nettement plus lente que la vitesse quasi temps réel qu'il atteint sur des GPU de classe entreprise.
- Kokoro est l'exception : avec 82 millions de paramètres, il tourne en temps réel ou plus vite sur CPU seul, selon sa fiche modèle Hugging Face, et n'a besoin d'un GPU que pour de la marge supplémentaire en génération par lots à haut volume.
XTTS v2 : meilleure qualité de clonage vocal
XTTS v2, publié par Coqui et exécuté via le toolkit Coqui TTS, est la meilleure option de clonage vocal local pour les possesseurs de GPU cherchant la meilleure qualité atteignable à partir d'un court extrait de référence. Il clone une voix à partir de seulement 6 secondes d'audio de référence et la restitue dans 17 langues, y compris en clonage translinguistique — cloner une voix à partir d'un audio anglais et la faire parler en espagnol ou en japonais.
Côté VRAM, les poids du modèle XTTS v2 pèsent environ 2 Go, mais 4 Go constituent le minimum pratique pour le faire tourner, et 4-6 Go sont recommandés pour une inférence en temps réel, selon le test XTTS v2 dédié de PromptQuorum. La licence est le facteur décisif pour la plupart des lecteurs : la Coqui Public Model License (CPML) est explicitement non commerciale, et comme Coqui AI, l'entreprise, a cessé ses services payants en décembre 2023, il n'existe actuellement aucune voie confirmée vers une licence commerciale.
- Utilisez XTTS v2 si : votre projet est personnel, académique ou un prototype non commercial et vous voulez la meilleure qualité de clonage disponible localement.
- Évitez XTTS v2 si : vous avez besoin d'une licence commerciale — ses conditions CPML sont non commerciales, sans voie de licence active confirmée depuis la fermeture de Coqui AI en 2023.
- VRAM : ~2 Go pour les poids du modèle, 4 Go minimum, 4-6 Go recommandés pour l'inférence en temps réel.
- Idéal pour : clonage vocal local de plus haute fidélité, prise en charge translinguistique de 17 langues, usage non commercial ou recherche.
Chatterbox : meilleur clonage en temps réel
Chatterbox, publié par Resemble AI sur GitHub, est le meilleur choix pour les possesseurs de GPU voulant du clonage vocal conversationnel en temps réel sous une licence entièrement permissive et compatible commercial. Il est sous licence MIT, qui — contrairement à la CPML non commerciale de XTTS v2 — autorise l'usage commercial sans accord séparé.
Chatterbox est disponible en plusieurs tailles : une variante Nano (110 millions de paramètres) que la documentation de Resemble AI décrit comme plus rapide que le temps réel sur 8 cœurs CPU, une variante Turbo (350 millions de paramètres) conçue pour la faible latence, et une variante multilingue (environ 500 millions de paramètres, sur une architecture qui crédite Llama 3) prenant en charge plus de 20 langues. Le clonage vocal zero-shot fonctionne à partir d'un extrait audio de référence — l'exemple officiel de Resemble AI utilise un clip de 10 secondes, bien que le README n'indique pas de durée minimale officielle comme celui de XTTS v2.
Le README public de Resemble AI ne publie pas de chiffre VRAM exact — traitez tout chiffre en Go précis vu ailleurs comme non vérifié tant que vous ne l'avez pas testé sur votre propre carte. Ce qui est documenté : la variante Nano fonctionne correctement sur CPU seul, tandis que les variantes Turbo et Multilingual, plus grandes, sont conçues pour une génération accélérée par GPU à faible latence — CUDA et Apple Silicon (MPS) sont tous deux pris en charge.
- Utilisez Chatterbox si : vous avez besoin d'un clonage vocal éligible à un usage commercial avec une latence en temps réel ou quasi temps réel, comme pour une application vocale interactive.
- Évitez Chatterbox si : vous avez besoin d'un chiffre VRAM minimum documenté et garanti avant d'acheter du matériel — Resemble AI n'en a pas publié.
- VRAM : non officiellement publié ; la variante Nano, plus petite, est compatible CPU, tandis que les variantes Turbo et Multilingual visent l'accélération GPU pour une vitesse temps réel.
- Idéal pour : produits commerciaux nécessitant un clonage vocal conversationnel zero-shot sous licence permissive.
- Chaque sortie Chatterbox porte le filigrane Perth propre à Resemble AI, décrit dans sa documentation comme un filigrane neuronal imperceptible qui survit à la compression MP3 — un signal de provenance intégré, pas un substitut au consentement (voir la section Clonage vocal et consentement ci-dessous).
Bark : meilleur audio expressif non vocal
Bark, publié par Suno sur GitHub, est le bon choix si vous voulez plus que de la parole — rires, soupirs, halètements et musique simple générés à partir de simples prompts textuels — et c'est le moteur de ce comparatif qui profite le plus d'un GPU, son architecture générative token par token étant la plus lente des quatre sans accélération CUDA. Il ne prend pas en charge le clonage vocal personnalisé ; selon la documentation officielle de Suno, il « ne prend actuellement pas en charge le clonage vocal personnalisé ».
Côté VRAM, le test Bark dédié de PromptQuorum documente un besoin d'environ 12 Go pour le modèle complet, avec un drapeau d'environnement pour petit modèle (SUNO_USE_SMALL_MODELS) le réduisant à environ 8 Go — sensiblement plus que les 4-6 Go de XTTS v2. Il est sous licence MIT, devenue pleinement compatible usage commercial le 1er mai 2023, mais son statut de maintenance pose une vraie question ouverte : le dépôt GitHub public ne montre aucun commit depuis le 5 avril 2024.
- Utilisez Bark si : vous avez besoin d'audio non vocal (rires, soupirs, son ambiant) en plus de la parole et disposez de 8-12 Go de VRAM.
- Évitez Bark si : vous avez besoin d'une sortie fiable et déterministe pour un pipeline de production, ou vous avez besoin de clonage vocal — Bark ne le prend pas en charge.
- VRAM : ~12 Go pour le modèle complet, ~8 Go avec le drapeau petit modèle — le plus lourd des quatre moteurs comparés ici.
- Idéal pour : génération d'audio expressif, effets sonores combinés à la parole, prototypage et recherche.
Kokoro : quand un GPU est superflu
Kokoro figure ici comme contre-exemple : posséder un GPU NVIDIA ne signifie pas que chaque charge TTS en a besoin, et Kokoro le prouve. Avec 82 millions de paramètres, il est nettement plus petit que XTTS v2, Chatterbox ou Bark, et sa propre fiche modèle Hugging Face documente une synthèse en temps réel ou plus rapide sur CPU seul, l'usage d'un GPU apportant de la marge plutôt qu'une nécessité.
Kokoro est sous licence Apache 2.0, qui — comme la licence MIT de Chatterbox — autorise l'usage commercial sans restriction. Il ne prend pas en charge le clonage vocal, il ne remplace donc pas XTTS v2 ou Chatterbox si le clonage est requis, mais pour de la narration simple, de la lecture de texte, ou une couche vocale dans une application où le clonage n'est pas nécessaire, c'est un choix plus léger et plus simple.
- Utilisez Kokoro si : votre charge est de la narration simple ou de la lecture de texte, vous voulez garder le VRAM de votre GPU libre pour un LLM ou une autre tâche, ou vous avez besoin d'un déploiement CPU uniquement.
- Évitez Kokoro si : vous avez besoin de clonage vocal — il ne le prend pas en charge, utilisez plutôt XTTS v2 ou Chatterbox.
- VRAM : environ 2 Go sur GPU ; tourne à vitesse temps réel sur CPU seul, selon sa propre fiche modèle.
- Idéal pour : narration simple et lecture de texte, cas où les moteurs de clonage plus lourds seraient vraiment superflus.
Tableau comparatif d'adéquation GPU
Ce tableau note les quatre moteurs spécifiquement sur des critères d'adéquation GPU — besoin en VRAM, bénéfice réel de l'accélération CUDA, capacité de clonage vocal et licence — pas sur la qualité audio brute.
📍 En une phrase
XTTS v2 est meilleur pour la plus haute qualité de clonage vocal ; Chatterbox est meilleur pour le clonage conversationnel commercial en temps réel ; Bark est meilleur pour l'audio expressif non vocal ; Kokoro est meilleur quand aucun clonage n'est requis et qu'un GPU serait gaspillé sur la tâche.
Moteur | VRAM (GPU) | Gain de vitesse GPU | Clonage vocal | Licence |
|---|---|---|---|---|
| XTTS v2 | 4-6 Go recommandés | Important — CPU peu praticable | Oui, clip 6s / 17 langues | CPML (non commerciale) |
| Chatterbox | Non officiellement publié | Important en temps réel | Oui, zero-shot | MIT |
| Bark | ~8-12 Go (petit/complet) | Le plus important des quatre | Non | MIT |
| Kokoro | ~2 Go, GPU optionnel | Faible — rapide même sur CPU | Non | Apache 2.0 |
Combien de VRAM vous faut-il vraiment ?
Un GPU avec 6 Go de VRAM ou plus couvre confortablement tous les moteurs de ce comparatif, sauf le modèle complet de Bark, qui nécessite environ 12 Go (ou environ 8 Go avec son drapeau petit modèle). Adaptez votre carte au moteur réellement nécessaire plutôt que d'acheter par défaut pour l'option la plus lourde.
Pour des conseils généraux sur le choix d'un GPU par palier de VRAM pour des charges IA locales (pas spécifique au TTS), voir le guide d'achat GPU pour LLM locaux de PromptQuorum — la même logique d'achat centrée sur le VRAM s'applique au TTS, et si vous faites déjà tourner un LLM local en parallèle du TTS, les deux charges se partagent le même réservoir de VRAM.
- GPU d'entrée de gamme (6-8 Go de VRAM) : couvre XTTS v2 confortablement, couvre Bark uniquement avec le drapeau petit modèle, couvre Kokoro et les variantes plus petites de Chatterbox sans difficulté.
- GPU milieu de gamme (12 Go de VRAM et plus) : couvre les quatre moteurs, y compris le modèle complet de Bark, avec de la marge pour d'autres charges.
- Faire tourner du TTS avec un LLM local : budgétisez le VRAM pour les deux — un LLM 7B en quantification Q4 nécessite à lui seul environ 4-5 Go, associez-le donc à XTTS v2 ou Kokoro plutôt qu'au modèle complet de Bark, sauf si votre carte dispose de 16 Go ou plus.
- En cas de doute, commencez avec Kokoro ou XTTS v2 — les deux tiennent confortablement dans 6 Go de VRAM, laissant de la place pour ajouter un moteur plus lourd plus tard si votre usage évolue.
Clonage vocal et consentement
Cloner la voix d'une personne réelle sans son consentement explicite est un problème distinct de la licence, et cela s'applique quel que soit le moteur, la licence ou le statut commercial en jeu. XTTS v2 et Chatterbox sont tous deux des outils de clonage vocal performants et généralistes ; aucun des deux ne vérifie que l'audio de référence fourni appartient à une personne ayant accepté d'être clonée.
Cloner une voix sans consentement peut poser des questions de consentement, de droit à l'image et, dans certaines juridictions, de fraude ou d'usurpation d'identité, indépendamment du caractère commercial ou personnel du projet, et indépendamment des conditions de licence du modèle. Ceci est une note factuelle, pas un conseil juridique — consultez un avocat si vous développez un produit clonant la voix de personnes réelles, et obtenez toujours un consentement clair et documenté de toute personne dont vous clonez la voix.
- Obtenez toujours un consentement explicite et documenté avant de cloner la voix d'une personne réelle, pour un usage personnel comme commercial.
- Le filigrane Perth intégré de Chatterbox aide à tracer l'audio généré jusqu'à l'outil, mais ne remplace pas le consentement et ne vérifie pas lui-même l'autorisation.
- Ni XTTS v2 ni Chatterbox n'effectuent de vérification du consentement — cette responsabilité incombe entièrement à qui exploite l'outil.
Questions fréquemment posées
Ai-je besoin d'un GPU NVIDIA pour faire tourner des moteurs TTS locaux ?
Non. Kokoro tourne à vitesse temps réel sur CPU seul, et XTTS v2, Chatterbox et Bark fonctionnent aussi sur CPU — juste nettement plus lentement. Un GPU rend ces trois derniers praticables en temps réel ou en traitement par lots, ce n'est pas une condition stricte pour les faire tourner tout court.
Quel moteur TTS local offre le meilleur clonage vocal ?
XTTS v2, publié par Coqui, est l'option de clonage vocal la plus qualitative traitée ici — il clone une voix à partir de seulement 6 secondes d'audio de référence, dans 17 langues. Sa licence, la Coqui Public Model License (CPML), est non commerciale. Chatterbox, publié par Resemble AI sous licence MIT, est le meilleur choix si vous avez besoin d'un clonage éligible à un usage commercial avec une latence conversationnelle en temps réel.
De combien de VRAM XTTS v2 a-t-il besoin ?
Les poids du modèle XTTS v2 pèsent environ 2 Go ; 4 Go sont le minimum pratique pour le faire tourner, et 4-6 Go sont recommandés pour l'inférence en temps réel, selon le test XTTS v2 dédié de PromptQuorum.
De combien de VRAM Bark a-t-il besoin ?
Le modèle complet de Bark nécessite environ 12 Go de VRAM ; définir le drapeau d'environnement SUNO_USE_SMALL_MODELS réduit cela à environ 8 Go. C'est le plus gourmand des quatre moteurs comparés dans ce guide.
Puis-je utiliser Chatterbox commercialement ?
Oui. Chatterbox, publié par Resemble AI, est sous licence MIT, qui autorise l'usage commercial sans accord séparé — contrairement à la licence CPML non commerciale de XTTS v2.
Un GPU est-il superflu pour du TTS local ?
Cela dépend de votre usage. Si vous avez seulement besoin de narration simple ou de lecture de texte sans clonage vocal, Kokoro (82 M de paramètres, Apache 2.0) tourne à vitesse temps réel sur CPU seul, et acheter ou dédier un GPU à cette tâche est inutile. Si vous avez besoin de clonage vocal ou d'audio expressif non vocal, un GPU améliore sensiblement XTTS v2, Chatterbox et Bark.
Quelle est la différence entre XTTS v2 et Chatterbox ?
XTTS v2 produit généralement des clones de plus haute fidélité et prend en charge 17 langues avec clonage translinguistique, mais sa licence CPML est non commerciale. Chatterbox est un modèle plus petit (environ 0,5 milliard de paramètres pour sa variante Multilingual) conçu pour une latence conversationnelle en temps réel, et sa licence MIT autorise l'usage commercial.
Bark prend-il en charge le clonage vocal ?
Non. Selon la documentation officielle de Suno, Bark « ne prend actuellement pas en charge le clonage vocal personnalisé ». Il peut générer de l'audio expressif — rires, soupirs, musique simple — avec des préréglages de voix sélectionnables, mais il ne peut pas cloner la voix d'une personne arbitraire à partir d'un enregistrement de référence comme le font XTTS v2 ou Chatterbox.
Puis-je faire tourner du TTS et un LLM local sur le même GPU ?
Oui, si vous budgétisez le VRAM pour les deux. Un LLM 7B en quantification Q4 nécessite à lui seul environ 4-5 Go, donc l'associer à XTTS v2 (4-6 Go) ou Kokoro (~2 Go) tient confortablement sur une carte de 12 Go ; associer un LLM au modèle complet de Bark (~12 Go) nécessite généralement 16 Go ou plus de VRAM au total.
Ai-je besoin d'un consentement pour cloner la voix de quelqu'un, même pour un projet personnel ?
Oui. Cloner la voix d'une personne réelle sans son consentement explicite et documenté pose des questions de consentement et de droit à l'image, que le projet soit personnel ou commercial, et quelle que soit la licence du moteur utilisé. Ceci est une note factuelle, pas un conseil juridique.
Verdict
Pour les lecteurs possédant déjà un GPU NVIDIA et voulant l'exploiter pour la synthèse vocale, le choix dépend de ce que l'audio doit accomplir. XTTS v2 est le choix pour la meilleure qualité de clonage vocal atteignable dans un contexte non commercial ou de recherche, du fait de sa licence CPML non commerciale. Chatterbox est le choix quand cette même capacité de clonage doit être livrée dans un produit commercial, grâce à sa licence MIT et ses modèles plus petits conçus pour le temps réel. Bark est le choix spécifiquement quand le projet a besoin d'audio expressif non vocal — rires, soupirs, musique simple — et peut consacrer 8-12 Go de VRAM pour l'obtenir, avec la réserve que son statut de maintenance est incertain. Kokoro reste le bon choix dès lors que le clonage n'est pas requis : il tourne confortablement sur CPU seul, donc réserver du VRAM GPU pour lui vaut rarement la peine. En cas de doute, commencez avec Kokoro pour de la narration simple et ne passez à XTTS v2 ou Chatterbox qu'une fois un véritable besoin de clonage identifié — cela garde le VRAM de votre GPU disponible pour tout ce que vous faites tourner à côté, y compris un LLM local. Pour les détails de licence de chaque moteur mentionné ici, voir le guide des licences TTS et clonage vocal locaux de PromptQuorum.
Sources
- XTTS v2 sur Hugging Face — fiche modèle : conditions de clonage, langues et référence de licence.
- Resemble AI : Chatterbox — présentation officielle du modèle, licence et nombre de paramètres.
- resemble-ai/chatterbox sur GitHub — README : installation, licence MIT, filigrane et prise en charge CPU/GPU.
- suno-ai/bark sur GitHub — README : licence, drapeau VRAM/petit modèle et historique de maintenance/commits.
- Kokoro-82M sur Hugging Face — fiche modèle : nombre de paramètres, licence Apache 2.0 et performance CPU/GPU.
- Test XTTS v2 — le test dédié de PromptQuorum avec commandes d'usage complètes et détails de licence.
- Test Bark TTS — le test dédié de PromptQuorum avec chiffres VRAM et statut de maintenance.
- Licences TTS et clonage vocal locaux — comparatif complet des licences et du VRAM des moteurs TTS locaux.
