Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Outils vocaux locaux comparés (2026) : synthèse vocale, transcription et agents vocaux
Voice, Speech & Multimodal

Outils vocaux locaux comparés (2026) : synthèse vocale, transcription et agents vocaux

·9 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Les 17 outils vocaux locaux de l'annuaire PromptQuorum se répartissent en trois tâches à comparer séparément : la synthèse vocale (8 outils), la transcription (7) et les agents vocaux en temps réel (4). En synthèse vocale, le clonage de voix est indiqué dans la documentation officielle de Coqui TTS, XTTS-v2, Izwi et Willow Inference Server ; en transcription, whisper.cpp et Willow Inference Server documentent la transcription en temps réel ; et Dograh, Jarvis, Parlor et Voxa sont les agents vocaux. Utilisez le tableau comparatif ci-dessous, et lisez l'avis de chaque outil avant de l'installer.

Les outils vocaux locaux relèvent de trois tâches différentes — transformer du texte en parole, transformer la parole en texte, et mener une conversation orale avec une IA — et aucune liste de fonctionnalités unique ne permet de les comparer équitablement. Ce guide compare 17 outils gratuits et freemium qui fonctionnent sur votre propre matériel, une tâche à la fois, à l'aide d'un tableau comparatif généré à partir des mêmes données que l'avis PromptQuorum de chaque outil : le tableau et les avis ne peuvent donc pas se contredire.

Cette page contient des liens de référence vers des produits tiers. PromptQuorum n'est inscrit à aucun programme d'affiliation — ce sont de simples liens qui ne génèrent aucune commission. Cliquer sur les liens et vos prochaines étapes relèvent entièrement de votre responsabilité. Ces liens ne représentent aucune approbation ou vérification par PromptQuorum.

Points clés

  • 17 outils, trois tâches : synthèse vocale (8), transcription (7), agents vocaux en temps réel (4). Izwi et Willow Inference Server font à la fois de la synthèse vocale et de la transcription, et apparaissent donc dans les deux tableaux.
  • Le tableau est généré à partir de la fiche de chaque outil et vérifié d'après son README ou son site officiel ; un tiret signifie « non précisé dans la documentation », jamais « non ».
  • Les licences diffèrent de façon significative : par exemple, Piper et OpenAI Edge TTS sont sous GPL-3.0, Coqui TTS sous MPL-2.0, XTTS-v2 utilise la Coqui Public Model License, et Bark, StyleTTS 2, whisper.cpp et faster-whisper sont sous MIT.
  • Chaque nom d'outil du tableau renvoie vers son propre avis PromptQuorum, où sont détaillés l'installation et les limites.

📍 En une phrase

Les outils vocaux locaux relèvent de trois tâches différentes — synthèse vocale, transcription et agents vocaux en temps réel — si bien que les 17 outils de l'annuaire PromptQuorum sont comparés tâche par tâche, à l'aide d'un tableau généré à partir des mêmes données que l'avis de chaque outil.

💬 En termes simples

Certains outils lisent un texte à voix haute, d'autres écrivent ce que vous dites, et d'autres encore tiennent une conversation orale avec une IA. Comparer un lecteur et un transcripteur sur le « clonage de voix » n'a pas de sens : ce guide compare donc des outils comparables.

Notre méthode de comparaison

Les informations de chaque outil — prix, licence, plateformes, besoins matériels et attributs propres à sa catégorie — sont enregistrées une seule fois, dans la fiche de l'outil dans l'annuaire. Le tableau comparatif ci-dessous est généré à partir de ces fiches, et l'avis de l'outil s'appuie sur la même fiche : les deux ne peuvent donc pas indiquer des valeurs différentes.

Les attributs propres à la catégorie (par exemple le clonage de voix ou la transcription en temps réel) ont été relevés dans le README ou sur le site officiel de chaque projet et vérifiés d'après la formulation exacte qui s'y trouve. Lorsque la documentation est muette, le tableau affiche un tiret plutôt que de deviner ; lorsqu'une affirmation est nuancée (expérimentale, réservée à l'offre payante ou dépendante d'un GPU), l'attribut est laissé de côté dans le tableau et traité dans l'avis de l'outil.

La comparaison recense des outils qui fonctionnent sur votre propre matériel. Elle ne les classe pas : le bon choix dépend de votre contrainte, et les sections ci-dessous indiquent où se situent les vraies différences.

Tableau comparatif

Choisissez une tâche ci-dessous, puis lisez la ligne d'un bout à l'autre. Cliquez sur le nom d'un outil pour ouvrir son avis PromptQuorum complet.

OutilPrixLicencePlateformesExécutionMatérielVersionLanguesClonage de voixSortie en streamingUtilisable sur CPU seulServeur API localAvislien produit · divulgué
BarkGratuitMITmacOS, Windows, LinuxLocalUn CPU suffit13NonLire l'avisBark
Coqui TTSGratuitMPL-2.0macOS, Windows, LinuxLocalUn CPU suffitv0.27.5OuiOuiOuiLire l'avisCoqui TTS
IzwiGratuitMITmacOS, Windows, LinuxLocalVariable selon le modèlev0.1.0-beta-17OuiOuiOuiLire l'avisIzwi
openai-edge-ttsGratuitGPL-3.0macOS, Windows, LinuxHybrideUn CPU suffitOuiOuiLire l'avisopenai-edge-tts
Piper TTSGratuitGPL-3.0macOS, Windows, LinuxLocalUn CPU suffitOuiLire l'avisPiper TTS
StyleTTS 2GratuitMITmacOS, Windows, LinuxLocalUn CPU suffitLire l'avisStyleTTS 2
Willow Inference ServerGratuitApache-2.0Linux, WindowsLocalUn CPU suffitOuiOuiOuiLire l'avisWillow Inference Server
XTTS v2GratuitCPMLmacOS, Windows, LinuxLocal17OuiLire l'avisXTTS v2

« — » signifie que la documentation du projet ne le précise pas, et non que la fonctionnalité est absente. Les valeurs proviennent du README ou du site officiel de chaque projet et sont revérifiées lors de la mise à jour de l'avis d'un outil.

Synthèse vocale : ce qui diffère

  • Licence. Bark et StyleTTS 2 sont sous licence MIT. Coqui TTS est sous MPL-2.0. XTTS-v2 utilise la Coqui Public Model License (CPML), une licence personnalisée avec ses propres conditions plutôt qu'une licence open source standard — lisez-la avant tout usage commercial. Piper et OpenAI Edge TTS sont sous GPL-3.0, qui impose des conditions à la distribution de versions modifiées. Vérifiez la licence avant de construire un produit sur l'un d'eux — voir Piper TTS et XTTS v2.
  • Clonage de voix. Coqui TTS (avis), XTTS-v2 (avis), Izwi (avis) et Willow Inference Server (avis) documentent le clonage de voix ou les voix personnalisées. Bark indique qu'il ne prend pas en charge le clonage de voix personnalisé.
  • Serveur API local. Coqui TTS, Izwi, OpenAI Edge TTS, Piper et Willow Inference Server documentent un composant serveur, ce qui permet à d'autres applications de les appeler via HTTP ; OpenAI Edge TTS est conçu autour de cette approche.
  • Langues. Bark documente 13 langues et XTTS-v2 en documente 17. Les autres outils n'indiquent pas de nombre comparable : le tableau affiche donc un tiret plutôt qu'un chiffre.

Transcription : ce qui diffère

  • Transcription en temps réel. whisper.cpp documente un exemple de streaming en temps réel, et Izwi et Willow Inference Server documentent un usage en temps réel. faster-whisper est une bibliothèque de transcription ; son README ne documente pas de mode temps réel.
  • Étiquettes de locuteurs. Izwi et FunClip documentent l'étiquetage des locuteurs. Meetily ne propose la diarisation des locuteurs que dans son offre Pro payante. Le marquage des tours de parole de whisper.cpp est expérimental et est traité dans son avis plutôt que dans le tableau.
  • Prix et plateforme. MacWhisper est une application macOS propriétaire avec une offre gratuite et une mise à niveau payante ; la plupart des autres outils présentés ici sont gratuits et open source. L'édition Community de Meetily est gratuite et sous licence MIT, avec une offre Pro payante.
  • Serveur API local. whisper.cpp fournit un serveur, et Izwi et Willow Inference Server documentent des API HTTP.

Agents vocaux : ce qui diffère

  • Entièrement local ou cloud optionnel. Jarvis documente une chaîne locale parole-vers-LLM-vers-parole ; Parlor documente un pipeline local avec une fonction de recherche cloud optionnelle. Voxa peut utiliser un fournisseur vocal local ou des fournisseurs cloud : il n'est donc entièrement local que si vous choisissez le fournisseur local.
  • Interruption (barge-in). Jarvis, Parlor et Voxa documentent la possibilité d'interrompre l'agent pendant qu'il parle.
  • Votre propre LLM et appels téléphoniques. Dograh documente un choix de LLM et des intégrations de téléphonie ; Voxa documente la connexion de votre propre modèle via un démon local.

Ce que cette comparaison ne peut pas vous dire

  • Elle compare des capacités documentées, pas la qualité. Elle ne dit rien du naturel d'une voix ni de la précision d'une transcription — cela demande vos propres fichiers audio et votre propre matériel.
  • Elle ne comprend pas de benchmarks de vitesse : PromptQuorum ne les a pas mesurés pour ces outils.
  • Les tirets sont des lacunes dans la documentation des projets, pas des constats négatifs. Certains outils peuvent prendre en charge une fonctionnalité que leur README ne mentionne pas.
  • Les outils évoluent vite. L'avis de chaque outil indique la version sur laquelle il a été vérifié, et ce guide est actualisé lorsqu'un avis l'est.

Questions fréquentes

Pourquoi la synthèse vocale, la transcription et les agents vocaux sont-ils comparés séparément ?

Ils remplissent des tâches différentes, de sorte que la plupart des attributs n'ont de sens que dans une seule tâche — le clonage de voix concerne la synthèse vocale, les étiquettes de locuteurs la transcription, l'interruption les agents vocaux. Les réunir dans un seul tableau laisserait la plupart des cellules vides ou sans signification.

Que signifie un tiret dans le tableau comparatif ?

Cela signifie que la documentation du projet ne précise pas cet attribut. Cela ne veut pas dire que la fonctionnalité est absente ; consultez l'avis de l'outil ou son dépôt.

Ces outils sont-ils vraiment locaux ?

Ils sont conçus pour fonctionner sur votre propre matériel, mais certains proposent des fonctions cloud optionnelles — par exemple la recherche cloud optionnelle de Parlor, ou les fournisseurs vocaux cloud de Voxa — et certains ont besoin d'internet au premier lancement pour télécharger des modèles. L'avis de chaque outil le détaille.

L'un de ces outils a-t-il un lien d'affiliation ?

Non. PromptQuorum n'a, au moment de la rédaction, aucune relation d'affiliation avec aucun outil de cette comparaison, et aucun lien présent ici ne rapporte de commission.

À quelle fréquence cette comparaison est-elle mise à jour ?

Elle est actualisée deux fois par an, et chaque fois que l'avis de l'un des outils listés est mis à jour, puisque le tableau est généré à partir des mêmes données que ces avis.

Sources

← Retour aux LLM locaux avancés