Points clés
- Willow Inference Server est gratuit et open source ; la licence officielle sur GitHub est la licence Apache 2.0
- Exécute la reconnaissance vocale automatique (ASR) et la synthèse vocale (TTS) basées sur Whisper, accessibles via WebRTC, REST et WebSockets
- Déployé via Docker Compose sous Linux (Windows via WSL) ; un fichier Docker Compose CPU uniquement est également fourni, bien que la performance CPU soit documentée comme nettement plus lente que le GPU
- Fonctionne sur des GPU NVIDIA allant de la GTX 1060 3 Go jusqu'à la RTX 4090 ; environ 6 Go de VRAM sont recommandés pour exécuter toutes les tailles de modèles Whisper par défaut plus le TTS ensemble
- Prend en charge la création de voix TTS personnalisée à partir d'un enregistrement d'exemple relativement court
- Développé par Tovera comme backend du projet matériel open source d'assistant vocal Willow
- Ne prend plus en charge l'inférence LLM/chat générale — cette fonctionnalité a été explicitement retirée dans un commit de février 2026 ; les mainteneurs du projet indiquent aux utilisateurs de faire tourner un outil séparé comme Ollama à côté pour ce besoin
- Le dépôt GitHub (github.com/toverainc/willow-inference-server) affiche environ 510 étoiles en septembre 2026 ; l'activité des commits se fait par rafales plutôt que de manière continue — considérez ceci comme un projet plus petit et plus lent qu'un projet commercial fortement doté en personnel
📍 En une phrase
Willow Inference Server est un serveur gratuit, open source et auto-hébergé qui exécute la reconnaissance vocale Whisper et la synthèse vocale sur votre propre GPU NVIDIA, sans aucune formule payante.
💬 En termes simples
Plutôt que d'envoyer vos enregistrements vocaux à une API vocale cloud, Willow Inference Server exécute les modèles de reconnaissance et de synthèse vocale sur un ordinateur que vous contrôlez, généralement équipé d'une carte graphique NVIDIA. Il a été conçu pour faire fonctionner le projet matériel d'assistant vocal Willow, mais peut fonctionner seul pour toute application ayant besoin de transformer la voix en texte ou le texte en voix sans dépendance au cloud.
📌Remarque: Cet avis est le complément approfondi de la fiche de Willow Inference Server dans le Répertoire des logiciels d'IA locale — consultez cette page pour voir comment il se compare en un coup d'œil à des dizaines d'autres outils d'IA locale.
Qu'est-ce que Willow Inference Server ?
Willow Inference Server est un serveur auto-hébergé qui exécute des modèles de reconnaissance et de synthèse vocale sur votre propre matériel, accessible via WebRTC, REST et WebSockets. Sa propre description sur GitHub indique : « Open source, local, and self-hosted highly optimized language inference server supporting ASR/STT, TTS, and LLM across WebRTC, REST, and WS » — une description que cet avis a jugée partiellement obsolète, puisque la prise en charge générale des LLM a été retirée du code en février 2026 (voir la section historique ci-dessous). Au moment de cet avis, WIS se décrit précisément comme un serveur ASR/TTS, et non comme un serveur LLM généraliste.
- Fonction principale : un serveur d'inférence vocale qui accepte de l'audio ou du texte via WebRTC, REST ou WebSockets et renvoie du texte transcrit ou de l'audio synthétisé
- Moteur de reconnaissance vocale : les modèles Whisper d'OpenAI, optimisés par le projet pour un streaming à faible latence
- Moteur de synthèse vocale : un pipeline TTS intégré (le dépôt inclut un
Dockerfile.xttset un répertoirexttsdédiés) prenant en charge la création de voix personnalisée à partir d'enregistrements courts - Cible de déploiement : GPU NVIDIA compatibles CUDA, avec un chemin de repli CPU uniquement documenté pour des performances moindres
- Développeur : Tovera, l'organisation derrière le projet matériel open source d'assistant vocal Willow
- Dépôt canonique : github.com/toverainc/willow-inference-server — le nom de projet et d'organisation actuellement actif pour le code source, les versions et le suivi des tickets du serveur
Historique du projet Willow Inference Server
Le dépôt GitHub de Willow Inference Server a été créé en février 2023, et son historique de commits montre des rafales d'activité séparées par de longues périodes calmes plutôt qu'un développement hebdomadaire continu — un schéma à connaître avant d'en dépendre pour un usage en production.
- 1Février 2023 — Dépôt créé
Why it matters: Willow Inference Server a démarré comme complément backend du projet matériel d'assistant vocal Willow, que l'organisation Tovera maintient également. - 2Avril 2024 — Mises à jour du moteur TTS
Why it matters: Les commits de cette période ont mis à jour le pipeline de clonage vocal XTTS intégré, selon l'historique de commits du dépôt. - 3Juin 2025 — Passe de qualité de code
Why it matters: Un lot de commits a remplacé le linting flake8 du projet par le formatage de code black et reformaté la base de code Python — une passe de maintenance plutôt qu'une sortie de fonctionnalité, après environ 14 mois sans commit public. - 4Février 2026 — Retrait de la prise en charge LLM/chat
Why it matters: Un commit intitulé « README: drop LLM/chat references » indique clairement : « We no longer support that. People can run ollama next to WIS. » C'est le changement le plus conséquent de l'histoire récente du projet — il réduit la portée de WIS d'un serveur combiné ASR/TTS/LLM à un serveur ASR/TTS uniquement, et c'est le commit le plus récent sur la branche principale du dépôt au moment de cet avis.
Que pouvez-vous faire avec Willow Inference Server ?
L'ensemble de fonctionnalités de Willow Inference Server se concentre sur le traitement vocal rapide et auto-hébergé plutôt que sur le chat par modèle de langage généraliste. Voici ce que chaque partie fait réellement, selon le README GitHub du projet.
- Reconnaissance vocale automatique (ASR) — transcrit l'audio parlé en texte à l'aide de modèles basés sur Whisper, optimisés par le projet pour une reconnaissance en streaming « aussi proche que possible du temps réel » plutôt qu'uniquement une transcription par lots
- Plusieurs tailles de modèles Whisper simultanées — le README indique que les trois tailles de modèles Whisper par défaut (base, medium, large-v2) peuvent être chargées simultanément dans 6 Go de VRAM, permettant à un déploiement d'arbitrer précision contre vitesse par requête plutôt que de s'engager sur une seule taille de modèle
- Synthèse vocale (TTS) avec clonage de voix — synthétise la parole à partir de texte, avec prise en charge de la création d'une voix personnalisée à partir d'un enregistrement d'exemple relativement court, via le pipeline intégré basé sur XTTS
- Accès multi-protocole — accessible via WebRTC (pour le streaming audio en temps réel à faible bande passante), REST et WebSockets, permettant à un client de choisir le transport adapté à son cas d'usage
- Détection automatique du matériel — le serveur est documenté comme détectant automatiquement le matériel disponible et adaptant son comportement en conséquence, plutôt que de nécessiter une configuration manuelle par modèle de GPU
- Backend de l'assistant vocal Willow — WIS est le backend d'inférence auquel se connecte le projet matériel open source d'assistant vocal Willow pour transformer les commandes vocales en texte et, en option, les réponses de nouveau en voix
Exemples d'utilisation : trois façons d'utiliser Willow Inference Server
Voici des flux de travail concrets construits à partir des fonctionnalités documentées de Willow Inference Server ci-dessus — pas des cas d'usage hypothétiques.
Installer Willow Inference Server
Willow Inference Server s'installe via Docker Compose, et son code source est sur GitHub. Les liens et commandes ci-dessous proviennent du dépôt GitHub officiel — vérifiez toujours directement sur cette page, car les instructions d'installation peuvent changer entre les commits.
Dépôt GitHub (code source, Apache 2.0)
Cloner le dépôt
- Lien:
git clone https://github.com/toverainc/willow-inference-server.git
Déploiement GPU
- Lien:
docker compose upavec le fichierdocker-compose.ymldu dépôt
Déploiement CPU uniquement
- Lien:
docker compose -f docker-compose-cpu.yml up(documenté comme nettement plus lent que GPU)
Projet assistant vocal Willow
- Lien:
- github.com/toverainc — les autres dépôts de l'organisation parente, dont le projet matériel/firmware Willow pour lequel WIS a été conçu à l'origine
Willow Inference Server nécessite un GPU NVIDIA compatible CUDA pour atteindre les performances documentées — une GTX 1060 3 Go est le minimum indiqué, avec environ 6 Go de VRAM recommandés pour faire tourner ASR et TTS ensemble. Un chemin Docker Compose CPU uniquement existe et est documenté dans le dépôt, mais le projet indique que la performance CPU est bien en retrait de tous les GPU listés ; considérez le mode CPU uniquement comme un repli fonctionnel pour les tests, pas comme une cible de déploiement en production.
Tarifs de Willow Inference Server : est-ce vraiment gratuit ?
Oui — Willow Inference Server n'a aucune formule payante. Le dépôt GitHub n'a pas de page de tarifs, et le fichier LICENSE.md s'applique à l'ensemble de l'application. Le texte de licence est la licence Apache, version 2.0 — permissive, avec une concession de brevet et sans obligation copyleft de publier vos propres modifications.
- Aucun abonnement, aucune formule payante, aucune limite d'utilisation imposée par Willow Inference Server lui-même
- Aucun compte ni inscription requis pour déployer ou utiliser le logiciel
- Faire tourner WIS nécessite toujours votre propre matériel GPU et le coût d'électricité/hébergement pour le faire fonctionner — le logiciel lui-même est gratuit, mais l'auto-hébergement n'est pas gratuit comme peut l'être une API hébergée
- Tovera exploite également un serveur d'exemple hébergé pour le projet matériel séparé d'assistant vocal Willow — cet avis couvre spécifiquement le logiciel WIS auto-hébergé et gratuit à faire tourner ; vérifiez directement auprès de Tovera pour tout détail sur une offre hébergée séparée et si elle comporte son propre coût
Willow Inference Server vs. whisper.cpp
Willow Inference Server et whisper.cpp exécutent tous deux les modèles de reconnaissance vocale Whisper d'OpenAI localement, et ils sont souvent comparés car aucun des deux n'envoie l'audio vers une API cloud. Les différences les plus nettes se situent dans le modèle de déploiement et la portée.
Aspect | WIS | whisper.cpp |
|---|---|---|
| Portée | Serveur ASR + TTS avec WebRTC/REST/WS | ASR (transcription) seule, pas de serveur/TTS |
| Déploiement | Docker Compose, axé GPU | Binaire/bibliothèque compilé, adapté au CPU |
| Matériel cible | GPU NVIDIA CUDA (3–6+ Go VRAM) | Tourne sur CPU ; accélération GPU en option |
| Streaming temps réel | Conçu pour, via WebRTC | Possible avec du travail client additionnel |
| Intégration matérielle | Conçu comme backend Willow | Bibliothèque généraliste, sans lien matériel |
| Rythme de maintenance | Par rafales ; dernier commit fév. 2026 | Maintenu activement, commits fréquents |
Si votre priorité est un serveur prêt à l'emploi avec streaming WebRTC et TTS intégrés, et que vous disposez d'un GPU NVIDIA disponible, l'ensemble de fonctionnalités de Willow Inference Server est le plus large des deux. Si votre priorité est la bibliothèque de transcription la plus légère possible et adaptée au CPU à intégrer dans votre propre application, whisper.cpp mérite d'être évalué directement — voir l'avis whisper.cpp pour tous les détails.
Qui devrait utiliser Willow Inference Server ?
Le fait que Willow Inference Server vous convienne dépend de la possession d'un GPU NVIDIA compatible, du besoin d'ASR et de TTS dans un seul serveur, et de votre tolérance pour un projet qui publie des mises à jour par rafales plutôt que de manière continue.
Willow Inference Server vs. autres outils vocaux
Willow Inference Server est l'une des nombreuses options auto-hébergées pour la reconnaissance et la synthèse vocales locales. Voici comment il se positionne face à d'autres outils dans ce domaine — voir le Répertoire des logiciels d'IA locale pour le catalogue complet, et la comparaison dédiée Willow Inference Server vs. whisper.cpp ci-dessus pour le face-à-face le plus proche.
- whisper.cpp — un portage C/C++ léger et adapté au CPU de Whisper d'OpenAI, pour la transcription uniquement, sans serveur intégré, WebRTC ou TTS ; voir la section de comparaison dédiée ci-dessus.
- Faster Whisper — une réimplémentation de Whisper basée sur CTranslate2, axée sur la vitesse d'inférence ; une bibliothèque à intégrer plutôt qu'un serveur ASR/TTS prêt à l'emploi comme WIS.
- Piper TTS — un moteur de synthèse vocale local léger et adapté au CPU ; plus restreint en portée que le serveur ASR+TTS combiné de WIS, mais bien plus léger en exigences matérielles.
- Coqui TTS — une boîte à outils open source de synthèse vocale avec prise en charge du clonage de voix, comparable en portée TTS au pipeline XTTS intégré de WIS, mais distribuée comme bibliothèque plutôt que comme serveur prêt pour WebRTC.
- Bark TTS — un modèle de synthèse vocale génératif capable de produire de l'audio non vocal (rires, pauses) ; un choix de moteur TTS différent du pipeline XTTS intégré de WIS.
- MacWhisper — une application de bureau macOS native pour la transcription Whisper ; une alternative de bureau graphique pour les utilisateurs qui n'ont pas du tout besoin du modèle de déploiement serveur/WebRTC de WIS.
Erreurs fréquentes lors de l'évaluation de Willow Inference Server
La plupart des confusions autour de Willow Inference Server proviennent de descriptions obsolètes de sa prise en charge des LLM, d'attentes matérielles floues, ou d'une surestimation de son rythme actuel de mises à jour.
Questions fréquemment posées
Qu'est-ce que Willow Inference Server ?
Willow Inference Server (WIS, github.com/toverainc/willow-inference-server) est un serveur gratuit, open source et auto-hébergé qui exécute la reconnaissance vocale et la synthèse vocale basées sur Whisper, accessible via WebRTC, REST et WebSockets. Il a été développé par Tovera comme backend du projet matériel d'assistant vocal Willow.
Willow Inference Server est-il gratuit ?
Oui. Le dépôt GitHub n'a pas de page de tarifs, et son fichier LICENSE.md est la licence Apache 2.0, s'appliquant à l'ensemble de l'application sans formule payante. Vous devez toujours fournir et payer votre propre matériel GPU pour le faire fonctionner.
Willow Inference Server prend-il en charge l'inférence LLM/chat ?
Non, pas au moment de cet avis. Un commit de février 2026 a retiré la prise en charge générale LLM/chat du projet, les mainteneurs déclarant : « We no longer support that. People can run ollama next to WIS. » Willow Inference Server est actuellement un serveur ASR/TTS uniquement.
Quel GPU faut-il pour Willow Inference Server ?
Un GPU NVIDIA compatible CUDA. Le projet documente une GTX 1060 3 Go comme minimum pratique, avec environ 6 Go de VRAM recommandés pour exécuter les trois tailles de modèles Whisper par défaut (base, medium, large-v2) plus le TTS ensemble. Un chemin Docker Compose CPU uniquement existe mais est documenté comme nettement plus lent.
Comment installer Willow Inference Server ?
Clonez le dépôt GitHub et exécutez docker compose up avec le docker-compose.yml fourni pour le déploiement GPU, ou docker compose -f docker-compose-cpu.yml up pour le chemin CPU uniquement. Vérifiez le dépôt directement pour les instructions actuelles avant d'installer, car elles peuvent changer entre les commits.
Willow Inference Server est-il activement maintenu ?
Son historique de commits montre des rafales d'activité séparées par des écarts de plusieurs mois plutôt qu'un développement continu — par exemple environ 14 mois sans commit public entre avril 2024 et juin 2025. Au moment de cet avis, le commit le plus récent sur la branche principale date de février 2026, et le dépôt n'a aucune version taguée. Il n'est pas archivé, mais c'est un projet plus petit, au rythme communautaire, plutôt qu'un projet avec une cadence de publication continue.
Quel est le lien entre Willow Inference Server et Willow ?
Willow est un projet matériel/firmware open source séparé d'assistant vocal, également maintenu par Tovera. Willow Inference Server est le logiciel backend qui traite la voix pour les appareils Willow, mais il peut aussi fonctionner de manière autonome pour d'autres cas d'usage de reconnaissance ou de synthèse vocale.
Willow Inference Server peut-il cloner une voix personnalisée pour le TTS ?
Oui. Son pipeline TTS intégré basé sur XTTS prend en charge, selon la documentation du projet, la création d'un profil de voix personnalisé à partir d'un enregistrement d'exemple relativement court.
Quelle licence utilise Willow Inference Server ?
La licence Apache, version 2.0, selon le fichier LICENSE.md officiel — permissive, avec une concession de brevet et sans obligation de publier en open source vos propres modifications.
Willow Inference Server prend-il en charge le streaming en temps réel ?
Oui, via WebRTC, que le projet a conçu spécifiquement pour des cas d'usage audio en temps réel à faible latence, comme un assistant vocal écoutant en continu des commandes. Des points de terminaison REST et WebSocket sont également disponibles pour des intégrations non-streaming ou plus simples.