Points clés
- Piper : aucun clonage vocal, voix fixes par langue, temps réel sur CPU (compatible Raspberry Pi), licence GPL-3.0-or-later.
- Chatterbox : clonage vocal zero-shot à partir d'environ 7 à 20 secondes d'audio, base Llama à 0,5 milliard de paramètres, licence MIT, GPU recommandé.
- Chatterbox inclut un réglage d'exagération pour l'intensité émotionnelle ; Piper n'a aucun contrôle émotionnel.
- Resemble AI rapporte une préférence en aveugle pour Chatterbox par rapport à ElevenLabs — une affirmation de l'éditeur du modèle, pas une conclusion de PromptQuorum.
- Les deux projets sont des logiciels open source gratuits, sans frais de licence.
- Le choix se fait selon le matériel et le besoin de clonage, pas selon une supériorité abstraite — ils résolvent des problèmes différents.
📍 En une phrase
Piper est un moteur de synthèse vocale neuronal léger, CPU uniquement, à voix préentraînées fixes et sans clonage, actuellement sous GPL-3.0-or-later ; Chatterbox est un modèle de 0,5 milliard de paramètres à base Llama, sous licence MIT, signé Resemble AI, qui clone une voix à partir d'un court extrait de référence et fonctionne mieux sur GPU.
💬 En termes simples
Piper est l'outil qui lit du texte à voix haute rapidement sur presque n'importe quel ordinateur, avec des voix déjà enregistrées et entraînées par quelqu'un d'autre. Chatterbox est l'outil capable de copier la voix d'une personne précise à partir d'un court enregistrement, puis de prononcer de nouvelles phrases avec cette voix — mais il lui faut une carte graphique plus puissante pour le faire rapidement.
📌Remarque: La licence de Piper est passée de MIT à GPL-3.0-or-later en 2025 lorsque le développement actif a rejoint l'Open Home Foundation. Si vous avez évalué Piper avant cela en supposant une licence MIT, vérifiez avant de l'intégrer dans un produit fermé — voir la section Licence et coût matériel ci-dessous.
Ce que fait réellement chaque outil
Piper et Chatterbox convertissent tous deux du texte en audio parlé, mais avec des architectures fondamentalement différentes et pour des besoins différents. Piper est optimisé pour la rapidité et la faible consommation de ressources avec un catalogue de voix fixe ; Chatterbox est optimisé pour cloner une voix précise à la demande.
- Piper : synthèse rapide, à voix fixe, orientée CPU. Piper convertit le texte en phonèmes via espeak-ng, puis synthétise une forme d'onde à partir de ces phonèmes avec un modèle de type VITS exporté vers ONNX Runtime, ce qui le rend assez rapide pour tourner en temps réel sur un Raspberry Pi. Chaque voix est un modèle entraîné séparément, téléchargeable — il n'existe aucun mécanisme pour générer une nouvelle voix à partir d'un échantillon.
- Chatterbox : clonage vocal zero-shot sur une base Llama. Chatterbox, publié par Resemble AI, utilise une architecture de 0,5 milliard de paramètres construite sur une base Llama. Avec un court extrait audio de référence — environ 7 à 20 secondes, selon la propre méthodologie d'évaluation publiée par Resemble AI — il clone cette voix et génère une nouvelle parole avec elle, sans réglage fin ni entraînement supplémentaire.
- Réglage d'exagération (Chatterbox uniquement). Chatterbox expose un paramètre
exaggeration(valeur par défaut 0,5) qui ajuste l'intensité émotionnelle de la parole générée ; la documentation du projet précise qu'augmenter ce paramètre tend à accélérer le débit, et qu'abaisser le paramètrecfg(classifier-free guidance) peut compenser avec un débit plus lent et plus posé. - Filigrane neuronal (Chatterbox uniquement). Chaque clip audio généré par Chatterbox inclut un filigrane Perth imperceptible, conçu par Resemble AI pour résister à la compression MP3 et aux montages audio courants, destiné à rendre la parole générée par IA identifiable a posteriori.
- Piper n'offre ni clonage, ni contrôle émotionnel, ni filigrane — c'est un outil volontairement plus étroit, qui échange ces capacités contre de la rapidité CPU uniquement et une empreinte de ressources bien plus légère.
Comparatif côte à côte
Piper l'emporte sur la rapidité et le coût matériel ; Chatterbox l'emporte sur le clonage vocal et l'expressivité. Aucun des deux n'est une amélioration stricte de l'autre — le tableau ci-dessous liste les différences concrètes qui doivent guider votre choix.
Usage principal
- Piper:
- Parole en temps réel sur CPU seul / matériel embarqué
- Chatterbox:
- Clonage vocal zero-shot et narration expressive
Clonage vocal
- Piper:
- Non — voix préentraînées fixes uniquement
- Chatterbox:
- Oui — à partir d'environ 7-20 secondes d'audio
Contrôle émotionnel
- Piper:
- Aucun
- Chatterbox:
- Oui — paramètre
exaggeration
Architecture
- Piper:
- Type VITS, ONNX Runtime, phonèmes espeak-ng
- Chatterbox:
- Base Llama à 0,5 milliard de paramètres
Matériel
- Piper:
- CPU (compatible Raspberry Pi) ; CUDA en option
- Chatterbox:
- GPU recommandé (
device="cuda") en temps réel
Licence actuelle
- Piper:
- GPL-3.0-or-later
- Chatterbox:
- MIT
Éditeur / mainteneur
- Piper:
- Open Home Foundation
- Chatterbox:
- Resemble AI
Filigrane
- Piper:
- Aucun
- Chatterbox:
- Oui — filigrane neuronal Perth
Exemples d'utilisation réels
Ces commandes proviennent de la CLI et de l'API Python documentées de chaque projet.
- Piper ne nécessite aucune configuration GPU —
pip install piper-ttsinstalle automatiquement sa dépendance CPU ONNX Runtime. - Chatterbox fonctionne sur CPU (
device="cpu"), mais la génération en temps réel et la faible latence documentée supposent une accélération GPU.
# ── Piper : installation et synthèse sur CPU ───────────────────────────
pip install piper-tts
python3 -m piper.download_voices en_US-lessac-medium
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."
# API Python de Piper
from piper import PiperVoice
voice = PiperVoice.load("en_US-lessac-medium.onnx")
with open("test.wav", "wb") as wav_file:
voice.synthesize_wav("Hello from Piper.", wav_file)
# ── Chatterbox : installation et clonage d'une voix ─────────────────────
pip install chatterbox-tts
import torchaudio as ta
from chatterbox.tts import ChatterboxTTS
device = "cuda" # GPU recommandé ; "cpu" fonctionne aussi, bien plus lent
model = ChatterboxTTS.from_pretrained(device=device)
# Génération avec la voix par défaut du modèle
wav = model.generate("This is a test.")
ta.save("output.wav", wav, model.sr)
# Clone zero-shot à partir d'un court extrait de référence, avec un réglage d'exagération
AUDIO_PROMPT_PATH = "reference_voice.wav"
wav = model.generate(
"This is the cloned voice speaking a new sentence.",
audio_prompt_path=AUDIO_PROMPT_PATH,
exaggeration=0.6,
)
ta.save("output_cloned.wav", wav, model.sr)Licence et coût matériel
Le dépôt actuellement maintenu de Piper, OHF-Voice/piper1-gpl, est sous licence GPL-3.0-or-later. Il s'agit d'un changement par rapport au dépôt d'origine rhasspy/piper, qui était sous licence MIT avant d'être archivé (passé en lecture seule) le 6 octobre 2025. GPL-3.0 est copyleft : utiliser Piper comme outil externe (CLI, paquet Python, ou serveur web appelé comme processus séparé) ne place généralement pas votre propre application sous GPL, mais distribuer une version modifiée du code source de Piper impose de publier ces modifications sous la même licence. Ceci n'est pas un conseil juridique — consultez un avocat avant tout déploiement commercial qui modifie et redistribue le code source de Piper.
Chatterbox est sous licence MIT, confirmé via le fichier LICENSE dans resemble-ai/chatterbox sur GitHub — une licence permissive qui autorise l'usage commercial, la modification et la redistribution avec des conditions minimales (conserver l'avis de copyright et le texte de la licence).
Le coût matériel est le vrai facteur différenciant, pas les frais de licence — les deux projets sont des logiciels gratuits. Piper tourne en temps réel sur du matériel CPU aussi modeste qu'un Raspberry Pi, donc son coût effectif est proche de zéro au-delà de l'appareil déjà possédé. Les performances à faible latence documentées de Chatterbox supposent une accélération GPU (device="cuda") ; bien l'exploiter implique généralement de prévoir un GPU compatible CUDA, qu'il s'agisse d'une carte NVIDIA grand public ou d'une instance GPU cloud louée, l'inférence CPU seule étant nettement plus lente.
Quelle licence utilise Piper aujourd'hui, et a-t-elle changé ?
Le dépôt activement maintenu OHF-Voice/piper1-gpl est sous licence GPL-3.0-or-later. Le dépôt d'origine rhasspy/piper était sous licence MIT avant d'être archivé le 6 octobre 2025. C'est une différence réelle pour un usage commercial — vérifiez la licence actuelle avant d'intégrer Piper dans un produit fermé.
Qui devrait utiliser quoi
Utilisez Piper si votre projet tourne sur du matériel CPU seul ou embarqué et n'a pas besoin de clonage vocal. Utilisez Chatterbox si vous devez cloner une voix précise à partir d'un court extrait de référence et pouvez l'exécuter sur GPU. La décision repose sur ces deux contraintes, pas sur une préférence générale de qualité.
- Assistants vocaux et appareils embarqués → Piper. Des performances en temps réel sur un Raspberry Pi ou du matériel basse consommation similaire, sans dépendance GPU, c'est exactement ce pour quoi Piper est conçu — c'est pourquoi il est le moteur TTS local par défaut de la chaîne vocale de Home Assistant.
- Outils d'accessibilité et lecteurs d'écran → Piper. Des voix fixes et fiables et une faible latence sur du matériel modeste comptent ici davantage que l'expressivité ou le clonage.
- Narration de livres audio ou doublage avec une voix précise → Chatterbox. Le clonage zero-shot à partir d'un court extrait de référence, combiné au réglage d'exagération pour le rythme et l'interprétation, convient à un travail de narration nécessitant une voix cohérente et reconnaissable.
- Produits vocaux personnalisés ou de marque → Chatterbox. Si la proposition de valeur du produit repose sur une voix clonée précise — un narrateur, une mascotte de marque, un assistant personnel avec une persona choisie —, Piper en est totalement incapable ; Chatterbox est conçu pour cela.
- Parcs de serveurs CPU seuls à budget serré, traitant un volume d'appels élevé → Piper. La faible consommation de ressources de Piper s'échelonne plus prévisiblement sur de nombreuses instances CPU seules simultanées qu'un modèle dépendant d'un GPU.
- En cas de doute, commencez par Piper. Il n'a aucune dépendance GPU, s'installe en une seule commande
pip install piper-tts, et couvre le cas courant de « lire ce texte à voix haute » sans aucune exigence de clonage. Ne passez à Chatterbox que lorsqu'un projet exige réellement de cloner une voix précise.
Ce pour quoi aucun des deux n'est adapté
Les deux outils ont de vraies limites en dehors de leurs objectifs de conception principaux.
- Piper ne peut absolument pas cloner une voix à partir d'un échantillon. Si une partie du besoin implique de reproduire la voix d'une personne précise à partir d'un audio de référence, Piper est le mauvais outil quelles que soient les contraintes matérielles — utilisez plutôt Chatterbox ou XTTS v2.
- Chatterbox sur matériel CPU seul ne convient pas bien au temps réel. Il fonctionne sur CPU (
device="cpu"), mais ses performances à faible latence documentées supposent une accélération GPU ; considérez Chatterbox en CPU seul comme adapté à la génération par lots hors ligne, pas à la parole interactive en temps réel. - Aucun des deux outils ne traite le consentement au clonage de la voix d'une personne réelle. Cloner ou synthétiser la voix d'une personne réelle et identifiable sans son consentement soulève des questions de consentement, de droit à l'image et potentiellement de fraude ou d'usurpation d'identité, qui existent indépendamment de la licence logicielle des deux projets — cela s'applique quel que soit l'outil utilisé, et quel que soit le contexte commercial ou personnel.
- La licence GPL-3.0 du dépôt actuel de Piper est une contrainte réelle pour une redistribution en source fermée. Si un déploiement implique de modifier et de redistribuer le code source de Piper à l'intérieur d'un produit fermé, les termes GPL-3.0-or-later du dépôt actuel s'appliquent — ce qui n'existait pas sous le dépôt d'origine sous licence MIT, donc les plans établis avant octobre 2025 doivent être revérifiés.
- La préférence rapportée de Chatterbox par rapport à ElevenLabs est une affirmation d'éditeur, pas un benchmark indépendant. Resemble AI, la société qui publie Chatterbox, rapporte une préférence des évaluateurs en aveugle pour Chatterbox par rapport à ElevenLabs, sur la base d'évaluations menées via la plateforme tierce Podonos. PromptQuorum n'a pas reproduit cette évaluation de manière indépendante ; considérez-la comme une affirmation de l'éditeur du modèle lui-même plutôt qu'un résultat tiers vérifié, et pondérez-la en conséquence si la qualité vocale face à ElevenLabs est un critère décisif pour votre projet.
Alternatives
XTTS v2
- Idéal pour:
- Clonage vocal multilingue sur 17 langues à partir d'environ 6 secondes d'audio
- Licence:
- CPML (non commercial)
Boîte à outils Coqui TTS
- Idéal pour:
- Boîte à outils multi-moteurs flexible (VITS, Tacotron2, XTTS) avec large support linguistique
- Licence:
- MPL-2.0
StyleTTS 2
- Idéal pour:
- Meilleure qualité de narration anglaise à sonorité naturelle (pas de clonage vocal)
- Licence:
- MIT
Bark
- Idéal pour:
- Audio expressif non vocal — rires, soupirs, sons d'ambiance
- Licence:
- MIT
ElevenLabs
- Idéal pour:
- API cloud gérée pour les équipes préférant ne pas s'auto-héberger, avec clonage vocal commercial
- Licence:
- Propriétaire (API cloud payante)
Questions fréquemment posées
Quelle est la principale différence entre Piper et Chatterbox TTS ?
Piper est un moteur de synthèse vocale léger, CPU uniquement, avec un ensemble fixe de voix préentraînées et aucune capacité de clonage. Chatterbox est un modèle de 0,5 milliard de paramètres à base Llama signé Resemble AI, qui clone une voix précise à partir d'un court extrait de référence et fonctionne mieux avec une accélération GPU. Ils résolvent des problèmes différents plutôt que de rivaliser sur le même axe.
Piper peut-il cloner une voix comme Chatterbox ?
Non. Piper synthétise la parole uniquement à partir de modèles de voix préentraînés que vous téléchargez et sélectionnez ; il n'a aucun mécanisme pour générer une nouvelle voix à partir d'un échantillon audio de référence. Pour le clonage vocal, utilisez plutôt Chatterbox ou XTTS v2.
Ai-je besoin d'un GPU pour exécuter Chatterbox ?
Pas strictement — Chatterbox prend en charge device="cpu" — mais ses performances à faible latence et en temps réel documentées supposent une accélération GPU via device="cuda". Chatterbox en CPU seul reste viable pour la génération par lots hors ligne, mais nettement plus lent que sur GPU.
Piper nécessite-t-il un GPU ?
Non. Piper est conçu pour tourner en temps réel sur du matériel CPU uniquement, y compris un Raspberry Pi. Une accélération GPU CUDA optionnelle est disponible via le paquet onnxruntime-gpu pour un débit supérieur, mais elle n'est pas requise.
Quelle licence utilise Chatterbox ?
Chatterbox est sous licence MIT, selon le fichier LICENSE du dépôt GitHub resemble-ai/chatterbox — une licence permissive qui autorise l'usage commercial, la modification et la redistribution avec des conditions minimales.
Quelle licence utilise Piper, et a-t-elle changé ?
Le dépôt activement maintenu OHF-Voice/piper1-gpl est sous licence GPL-3.0-or-later. Le dépôt d'origine rhasspy/piper était sous licence MIT avant d'être archivé le 6 octobre 2025, lorsque le développement actif a rejoint l'Open Home Foundation. Vérifiez la licence actuelle avant d'intégrer Piper dans un produit fermé.
Est-il vrai que Chatterbox bat ElevenLabs dans des tests en aveugle ?
Resemble AI, la société qui publie Chatterbox, rapporte qu'une majorité d'évaluateurs en aveugle a préféré Chatterbox à ElevenLabs dans une évaluation menée via la plateforme tierce Podonos. Il s'agit d'une affirmation publiée par l'éditeur de Chatterbox lui-même ; PromptQuorum ne l'a pas reproduite de manière indépendante, et les lecteurs doivent la considérer comme une affirmation à vérifier plutôt que comme un benchmark indépendant établi.
Combien d'audio de référence faut-il à Chatterbox pour cloner une voix ?
Environ 7 à 20 secondes d'audio de référence, selon la propre méthodologie d'évaluation publiée par Resemble AI pour Chatterbox. Un extrait de référence plus propre, avec un seul locuteur, produit généralement un clone plus précis.
Lequel utiliser pour un assistant vocal local ?
Piper, dans presque tous les cas. Les assistants vocaux tournent généralement sur du matériel CPU seul modeste et n'ont pas besoin de cloner la voix d'une personne précise — les performances CPU en temps réel de Piper et l'absence de dépendance GPU correspondent directement à ce cas d'usage, ce qui explique pourquoi il est le moteur TTS local par défaut de la chaîne vocale de Home Assistant.
Puis-je utiliser Piper et Chatterbox ensemble dans le même projet ?
Oui — il n'y a aucun conflit technique. Un schéma courant consiste à utiliser Piper pour une narration rapide et générique en CPU seul, et Chatterbox spécifiquement pour la partie du contenu nécessitant une voix clonée ou émotionnellement expressive, en n'acceptant l'exigence GPU supplémentaire que là où elle est réellement nécessaire.
Verdict
Piper et Chatterbox ne sont pas vraiment concurrents — ils répondent à des questions différentes. Si la question est « comment obtenir une synthèse vocale locale rapide, fiable et entièrement sur site, sur du matériel sans GPU », Piper est la réponse bien établie : temps réel sur un Raspberry Pi, aucun clonage nécessaire ni proposé, et un simple pip install piper-tts. Si la question est « comment faire dire de nouvelles choses à une voix précise à partir d'un court extrait de référence », Chatterbox est conçu exactement pour cela, avec une licence MIT, une base Llama de 0,5 milliard de paramètres, et un réglage d'exagération pour l'interprétation émotionnelle — au prix de vouloir un GPU pour bien le faire. L'avantage rapporté de Chatterbox par rapport à ElevenLabs dans des évaluations en aveugle mérite d'être connu, mais c'est l'affirmation propre de Resemble AI, pas un résultat vérifié de manière indépendante — pesez-le comme un argument marketing, pas comme un fait établi. Pour la plupart des projets d'assistant vocal local et de matériel embarqué, commencez par Piper ; passez à Chatterbox seulement lorsque le clonage d'une voix précise devient un besoin réel, et associez ce comparatif au test Piper TTS ou au test XTTS v2 dédiés de PromptQuorum pour un regard plus approfondi sur chaque option.
Sources
- OHF-Voice/piper1-gpl sur GitHub — le dépôt Piper activement maintenu : README, documentation, licence, historique des versions.
- rhasspy/piper sur GitHub — le dépôt Piper d'origine, aujourd'hui archivé (licence MIT), archivé le 6 octobre 2025.
- resemble-ai/chatterbox sur GitHub — le dépôt officiel de Chatterbox : README, licence, documentation d'installation et d'utilisation.
- Resemble AI : Chatterbox — la page de Resemble AI décrivant la préférence rapportée des évaluateurs en aveugle par rapport à ElevenLabs via Podonos.
- Test Piper TTS — le test dédié de PromptQuorum sur Piper, incluant l'historique du changement de licence de 2025.
