Points clés
- 17 outils, trois tâches : synthèse vocale (8), transcription (7), agents vocaux en temps réel (4). Izwi et Willow Inference Server font à la fois de la synthèse vocale et de la transcription, et apparaissent donc dans les deux tableaux.
- Le tableau est généré à partir de la fiche de chaque outil et vérifié d'après son README ou son site officiel ; un tiret signifie « non précisé dans la documentation », jamais « non ».
- Les licences diffèrent de façon significative : par exemple, Piper et OpenAI Edge TTS sont sous GPL-3.0, Coqui TTS sous MPL-2.0, XTTS-v2 utilise la Coqui Public Model License, et Bark, StyleTTS 2, whisper.cpp et faster-whisper sont sous MIT.
- Chaque nom d'outil du tableau renvoie vers son propre avis PromptQuorum, où sont détaillés l'installation et les limites.
📍 En une phrase
Les outils vocaux locaux relèvent de trois tâches différentes — synthèse vocale, transcription et agents vocaux en temps réel — si bien que les 17 outils de l'annuaire PromptQuorum sont comparés tâche par tâche, à l'aide d'un tableau généré à partir des mêmes données que l'avis de chaque outil.
💬 En termes simples
Certains outils lisent un texte à voix haute, d'autres écrivent ce que vous dites, et d'autres encore tiennent une conversation orale avec une IA. Comparer un lecteur et un transcripteur sur le « clonage de voix » n'a pas de sens : ce guide compare donc des outils comparables.
Notre méthode de comparaison
Les informations de chaque outil — prix, licence, plateformes, besoins matériels et attributs propres à sa catégorie — sont enregistrées une seule fois, dans la fiche de l'outil dans l'annuaire. Le tableau comparatif ci-dessous est généré à partir de ces fiches, et l'avis de l'outil s'appuie sur la même fiche : les deux ne peuvent donc pas indiquer des valeurs différentes.
Les attributs propres à la catégorie (par exemple le clonage de voix ou la transcription en temps réel) ont été relevés dans le README ou sur le site officiel de chaque projet et vérifiés d'après la formulation exacte qui s'y trouve. Lorsque la documentation est muette, le tableau affiche un tiret plutôt que de deviner ; lorsqu'une affirmation est nuancée (expérimentale, réservée à l'offre payante ou dépendante d'un GPU), l'attribut est laissé de côté dans le tableau et traité dans l'avis de l'outil.
La comparaison recense des outils qui fonctionnent sur votre propre matériel. Elle ne les classe pas : le bon choix dépend de votre contrainte, et les sections ci-dessous indiquent où se situent les vraies différences.
Tableau comparatif
Choisissez une tâche ci-dessous, puis lisez la ligne d'un bout à l'autre. Cliquez sur le nom d'un outil pour ouvrir son avis PromptQuorum complet.
| Outil | Prix | Licence | Plateformes | Exécution | Matériel | Version | Langues | Clonage de voix | Sortie en streaming | Utilisable sur CPU seul | Serveur API local | Avis | lien produit · divulgué |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Bark | Gratuit | MIT | macOS, Windows, Linux | Local | Un CPU suffit | — | 13 | Non | — | — | — | Lire l'avis → | Bark |
| Coqui TTS | Gratuit | MPL-2.0 | macOS, Windows, Linux | Local | Un CPU suffit | v0.27.5 | — | Oui | Oui | — | Oui | Lire l'avis → | Coqui TTS |
| Izwi | Gratuit | MIT | macOS, Windows, Linux | Local | Variable selon le modèle | v0.1.0-beta-17 | — | Oui | — | Oui | Oui | Lire l'avis → | Izwi |
| openai-edge-tts | Gratuit | GPL-3.0 | macOS, Windows, Linux | Hybride | Un CPU suffit | — | — | — | Oui | — | Oui | Lire l'avis → | openai-edge-tts |
| Piper TTS | Gratuit | GPL-3.0 | macOS, Windows, Linux | Local | Un CPU suffit | — | — | — | — | — | Oui | Lire l'avis → | Piper TTS |
| StyleTTS 2 | Gratuit | MIT | macOS, Windows, Linux | Local | Un CPU suffit | — | — | — | — | — | — | Lire l'avis → | StyleTTS 2 |
| Willow Inference Server | Gratuit | Apache-2.0 | Linux, Windows | Local | Un CPU suffit | — | — | Oui | Oui | — | Oui | Lire l'avis → | Willow Inference Server |
| XTTS v2 | Gratuit | CPML | macOS, Windows, Linux | Local | — | — | 17 | Oui | — | — | — | Lire l'avis → | XTTS v2 |
« — » signifie que la documentation du projet ne le précise pas, et non que la fonctionnalité est absente. Les valeurs proviennent du README ou du site officiel de chaque projet et sont revérifiées lors de la mise à jour de l'avis d'un outil.
Synthèse vocale : ce qui diffère
- Licence. Bark et StyleTTS 2 sont sous licence MIT. Coqui TTS est sous MPL-2.0. XTTS-v2 utilise la Coqui Public Model License (CPML), une licence personnalisée avec ses propres conditions plutôt qu'une licence open source standard — lisez-la avant tout usage commercial. Piper et OpenAI Edge TTS sont sous GPL-3.0, qui impose des conditions à la distribution de versions modifiées. Vérifiez la licence avant de construire un produit sur l'un d'eux — voir Piper TTS et XTTS v2.
- Clonage de voix. Coqui TTS (avis), XTTS-v2 (avis), Izwi (avis) et Willow Inference Server (avis) documentent le clonage de voix ou les voix personnalisées. Bark indique qu'il ne prend pas en charge le clonage de voix personnalisé.
- Serveur API local. Coqui TTS, Izwi, OpenAI Edge TTS, Piper et Willow Inference Server documentent un composant serveur, ce qui permet à d'autres applications de les appeler via HTTP ; OpenAI Edge TTS est conçu autour de cette approche.
- Langues. Bark documente 13 langues et XTTS-v2 en documente 17. Les autres outils n'indiquent pas de nombre comparable : le tableau affiche donc un tiret plutôt qu'un chiffre.
Transcription : ce qui diffère
- Transcription en temps réel. whisper.cpp documente un exemple de streaming en temps réel, et Izwi et Willow Inference Server documentent un usage en temps réel. faster-whisper est une bibliothèque de transcription ; son README ne documente pas de mode temps réel.
- Étiquettes de locuteurs. Izwi et FunClip documentent l'étiquetage des locuteurs. Meetily ne propose la diarisation des locuteurs que dans son offre Pro payante. Le marquage des tours de parole de whisper.cpp est expérimental et est traité dans son avis plutôt que dans le tableau.
- Prix et plateforme. MacWhisper est une application macOS propriétaire avec une offre gratuite et une mise à niveau payante ; la plupart des autres outils présentés ici sont gratuits et open source. L'édition Community de Meetily est gratuite et sous licence MIT, avec une offre Pro payante.
- Serveur API local. whisper.cpp fournit un serveur, et Izwi et Willow Inference Server documentent des API HTTP.
Agents vocaux : ce qui diffère
- Entièrement local ou cloud optionnel. Jarvis documente une chaîne locale parole-vers-LLM-vers-parole ; Parlor documente un pipeline local avec une fonction de recherche cloud optionnelle. Voxa peut utiliser un fournisseur vocal local ou des fournisseurs cloud : il n'est donc entièrement local que si vous choisissez le fournisseur local.
- Interruption (barge-in). Jarvis, Parlor et Voxa documentent la possibilité d'interrompre l'agent pendant qu'il parle.
- Votre propre LLM et appels téléphoniques. Dograh documente un choix de LLM et des intégrations de téléphonie ; Voxa documente la connexion de votre propre modèle via un démon local.
Ce que cette comparaison ne peut pas vous dire
- Elle compare des capacités documentées, pas la qualité. Elle ne dit rien du naturel d'une voix ni de la précision d'une transcription — cela demande vos propres fichiers audio et votre propre matériel.
- Elle ne comprend pas de benchmarks de vitesse : PromptQuorum ne les a pas mesurés pour ces outils.
- Les tirets sont des lacunes dans la documentation des projets, pas des constats négatifs. Certains outils peuvent prendre en charge une fonctionnalité que leur README ne mentionne pas.
- Les outils évoluent vite. L'avis de chaque outil indique la version sur laquelle il a été vérifié, et ce guide est actualisé lorsqu'un avis l'est.
Questions fréquentes
Pourquoi la synthèse vocale, la transcription et les agents vocaux sont-ils comparés séparément ?
Ils remplissent des tâches différentes, de sorte que la plupart des attributs n'ont de sens que dans une seule tâche — le clonage de voix concerne la synthèse vocale, les étiquettes de locuteurs la transcription, l'interruption les agents vocaux. Les réunir dans un seul tableau laisserait la plupart des cellules vides ou sans signification.
Que signifie un tiret dans le tableau comparatif ?
Cela signifie que la documentation du projet ne précise pas cet attribut. Cela ne veut pas dire que la fonctionnalité est absente ; consultez l'avis de l'outil ou son dépôt.
Ces outils sont-ils vraiment locaux ?
Ils sont conçus pour fonctionner sur votre propre matériel, mais certains proposent des fonctions cloud optionnelles — par exemple la recherche cloud optionnelle de Parlor, ou les fournisseurs vocaux cloud de Voxa — et certains ont besoin d'internet au premier lancement pour télécharger des modèles. L'avis de chaque outil le détaille.
L'un de ces outils a-t-il un lien d'affiliation ?
Non. PromptQuorum n'a, au moment de la rédaction, aucune relation d'affiliation avec aucun outil de cette comparaison, et aucun lien présent ici ne rapporte de commission.
À quelle fréquence cette comparaison est-elle mise à jour ?
Elle est actualisée deux fois par an, et chaque fois que l'avis de l'un des outils listés est mis à jour, puisque le tableau est généré à partir des mêmes données que ces avis.
Sources
- Le README ou le site officiel de chaque outil, indiqué dans l'avis PromptQuorum de cet outil (lié depuis le tableau comparatif).
- Annuaire PromptQuorum des applications d'IA locale — la fiche à partir de laquelle chaque ligne du tableau est générée.
- Licences des outils d'IA expliquées — ce que signifient les familles de licences citées ci-dessus.