Conclusiones clave
- Willow Inference Server es gratuito y de código abierto; la LICENSE oficial en GitHub es la licencia Apache 2.0
- Ejecuta reconocimiento de voz automático (ASR) y texto a voz (TTS) basados en Whisper, accesibles mediante WebRTC, REST y WebSockets
- Se despliega mediante Docker Compose en Linux (Windows mediante WSL); también se ofrece un archivo Docker Compose solo para CPU, aunque el rendimiento en CPU se documenta como notablemente más lento que en GPU
- Funciona en GPU NVIDIA desde la GTX 1060 3 GB hasta la RTX 4090; se recomiendan unos 6 GB de VRAM para ejecutar todos los tamaños de modelo Whisper por defecto junto con TTS
- Admite la creación de voces TTS personalizadas a partir de una grabación de muestra relativamente corta
- Creado por Tovera como backend del proyecto de hardware de código abierto del asistente de voz Willow
- Ya no admite inferencia LLM/chat general — esa función se eliminó explícitamente en un commit de febrero de 2026; los propios mantenedores del proyecto indican a los usuarios que ejecuten una herramienta separada como Ollama en paralelo para esa necesidad
- El repositorio de GitHub (github.com/toverainc/willow-inference-server) muestra unas 510 estrellas a septiembre de 2026; la actividad de commits es intermitente en lugar de continua — considera esto un proyecto más pequeño y de ritmo más lento que uno comercial con mucho personal
📍 En una frase
Willow Inference Server es un servidor gratuito, de código abierto y autoalojado que ejecuta reconocimiento de voz basado en Whisper y texto a voz en tu propia GPU NVIDIA, sin ningún plan de pago.
💬 En términos simples
En lugar de enviar tus grabaciones de voz a una API de voz en la nube, Willow Inference Server ejecuta los modelos de voz a texto y texto a voz en un equipo que tú controlas, normalmente uno con una tarjeta gráfica NVIDIA. Se creó para impulsar el proyecto de hardware del asistente de voz Willow, pero puede funcionar de forma independiente para cualquier aplicación que necesite convertir voz en texto o texto en voz sin depender de la nube.
📌Nota: Esta reseña es el complemento en profundidad de la ficha de Willow Inference Server en el Directorio de Software de IA Local — consulta esa página para ver cómo se compara de un vistazo con docenas de otras herramientas de IA local.
¿Qué es Willow Inference Server?
Willow Inference Server es un servidor autoalojado que ejecuta modelos de reconocimiento y síntesis de voz en tu propio hardware, accesible mediante WebRTC, REST y WebSockets. Su propia descripción en GitHub dice: «Open source, local, and self-hosted highly optimized language inference server supporting ASR/STT, TTS, and LLM across WebRTC, REST, and WS» — una descripción que esta reseña considera ahora parcialmente desactualizada, ya que el soporte general de LLM se eliminó del código en febrero de 2026 (ver la sección de historia más abajo). Al momento de esta reseña, WIS se describe correctamente como un servidor ASR/TTS, no como un servidor LLM general.
- Función principal: un servidor de inferencia de voz que acepta audio o texto mediante WebRTC, REST o WebSockets y devuelve texto transcrito o audio sintetizado
- Motor de reconocimiento de voz: modelos Whisper de OpenAI, ajustados por el proyecto para transmisión de baja latencia
- Motor de texto a voz: una canalización TTS integrada (el repositorio incluye un
Dockerfile.xttsy un directorioxttsdedicados) con soporte para crear voces personalizadas a partir de grabaciones de muestra cortas - Objetivo de despliegue: GPU NVIDIA compatibles con CUDA, con una ruta de respaldo solo para CPU documentada para un rendimiento menor
- Desarrollador: Tovera, la organización detrás del proyecto de hardware de código abierto del asistente de voz Willow
- Repositorio canónico: github.com/toverainc/willow-inference-server — el nombre de proyecto y organización actualmente activo para el código fuente, las versiones y el seguimiento de incidencias del servidor
Historia del proyecto Willow Inference Server
El repositorio de GitHub de Willow Inference Server se creó en febrero de 2023, y su historial de commits muestra ráfagas de actividad separadas por largos periodos de calma en lugar de un desarrollo semanal continuo — un patrón que conviene conocer antes de depender de él para producción.
- 1Febrero de 2023 — Repositorio creado
Why it matters: Willow Inference Server empezó como complemento de backend del proyecto de hardware del asistente de voz Willow, que la organización Tovera también mantiene. - 2Abril de 2024 — Actualizaciones del motor TTS
Why it matters: Los commits de este periodo actualizaron la canalización de clonación de voz XTTS integrada, según el historial de commits del repositorio. - 3Junio de 2025 — Pase de calidad de código
Why it matters: Un lote de commits reemplazó el linting flake8 del proyecto por el formateo de código black y reformateó la base de código en Python — un pase de mantenimiento más que un lanzamiento de funciones, tras unos 14 meses sin commits públicos. - 4Febrero de 2026 — Eliminación del soporte LLM/chat
Why it matters: Un commit titulado «README: drop LLM/chat references» declara con claridad: «We no longer support that. People can run ollama next to WIS.» Este es el cambio más importante en la historia reciente del proyecto — reduce el alcance de WIS de un servidor combinado ASR/TTS/LLM a un servidor solo ASR/TTS, y es el commit más reciente en la rama principal del repositorio al momento de esta reseña.
¿Qué puedes hacer con Willow Inference Server?
El conjunto de funciones de Willow Inference Server se centra en el procesamiento de voz rápido y autoalojado, en lugar del chat de propósito general con modelos de lenguaje. Esto es lo que hace realmente cada parte, según el propio README de GitHub del proyecto.
- Reconocimiento automático de voz (ASR) — transcribe audio hablado a texto usando modelos basados en Whisper, ajustados por el proyecto hacia un reconocimiento en streaming «lo más cercano posible al tiempo real», en lugar de solo transcripción por lotes
- Múltiples tamaños de modelo Whisper simultáneos — el README indica que los tres tamaños de modelo Whisper por defecto (base, medium, large-v2) se pueden cargar simultáneamente dentro de 6 GB de VRAM, lo que permite a un despliegue equilibrar precisión frente a velocidad por solicitud en lugar de comprometerse con un solo tamaño de modelo
- Texto a voz (TTS) con clonación de voz — sintetiza voz a partir de texto, con soporte para crear una voz personalizada a partir de una grabación de muestra relativamente corta, mediante la canalización integrada basada en XTTS
- Acceso multiprotocolo — accesible mediante WebRTC (para transmisión de audio en tiempo real y bajo ancho de banda), REST y WebSockets, para que un cliente pueda elegir el transporte que mejor se adapte a su caso de uso
- Detección automática de hardware — el servidor está documentado como capaz de detectar automáticamente el hardware disponible y ajustar su comportamiento en consecuencia, en lugar de requerir configuración manual para cada modelo de GPU
- Backend del asistente de voz Willow — WIS es el backend de inferencia al que se conecta el proyecto de hardware de código abierto del asistente de voz Willow para convertir comandos hablados en texto y, opcionalmente, respuestas de vuelta en voz
Ejemplos de uso: tres formas de usar Willow Inference Server
Estos son flujos de trabajo concretos construidos a partir de las funciones documentadas de Willow Inference Server anteriores — no casos de uso hipotéticos.
Instalar Willow Inference Server
Willow Inference Server se instala mediante Docker Compose, y su código fuente está en GitHub. Los enlaces y comandos a continuación provienen del repositorio oficial de GitHub — verifica siempre directamente en esa página, ya que las instrucciones de instalación pueden cambiar entre commits.
Repositorio GitHub (código, Apache 2.0)
Clonar el repositorio
- Enlace:
git clone https://github.com/toverainc/willow-inference-server.git
Despliegue con GPU
- Enlace:
docker compose upusando eldocker-compose.ymldel repositorio
Despliegue solo con CPU
- Enlace:
docker compose -f docker-compose-cpu.yml up(documentado como notablemente más lento que con GPU)
Proyecto asistente de voz Willow
- Enlace:
- github.com/toverainc — otros repositorios de la organización matriz, incluido el proyecto de hardware/firmware Willow para el que WIS se creó originalmente
Willow Inference Server necesita una GPU NVIDIA compatible con CUDA para alcanzar las cifras de rendimiento documentadas — una GTX 1060 3 GB es el mínimo indicado, con unos 6 GB de VRAM recomendados para ejecutar ASR y TTS juntos. Existe una ruta de Docker Compose solo para CPU, documentada en el repositorio, pero el proyecto indica que el rendimiento en CPU queda muy por detrás de cualquiera de las GPU listadas; considera el modo solo CPU como un respaldo funcional para pruebas, no como un objetivo de despliegue en producción.
Precios de Willow Inference Server: ¿es realmente gratis?
Sí — Willow Inference Server no tiene ningún plan de pago. El repositorio de GitHub no tiene página de precios, y el archivo LICENSE.md se aplica a toda la aplicación. El texto de la licencia es la licencia Apache, versión 2.0 — permisiva, con concesión de patentes y sin obligación de copyleft de publicar tus propias modificaciones.
- Sin suscripción, sin plan de pago, sin límites de uso impuestos por Willow Inference Server
- No se requiere cuenta ni registro para desplegar o usar el software
- Ejecutar WIS sigue requiriendo tu propio hardware GPU y el coste de electricidad/alojamiento para hacerlo funcionar — el software en sí es gratuito, pero el autoalojamiento no tiene coste cero como puede tenerlo una API alojada
- Tovera también opera un servidor de ejemplo alojado para el proyecto de hardware separado del asistente de voz Willow — esta reseña cubre específicamente el software WIS autoalojado y gratuito de ejecutar; verifica directamente con Tovera cualquier detalle sobre una oferta alojada separada y si conlleva su propio coste
Willow Inference Server vs. whisper.cpp
Willow Inference Server y whisper.cpp ejecutan ambos los modelos de reconocimiento de voz Whisper de OpenAI localmente, y se comparan a menudo porque ninguno de los dos envía audio a una API en la nube. Las diferencias más claras están en el modelo de despliegue y el alcance.
Aspecto | WIS | whisper.cpp |
|---|---|---|
| Alcance | Servidor ASR + TTS con WebRTC/REST/WS | Solo ASR (transcripción), sin servidor/TTS |
| Despliegue | Docker Compose, enfocado en GPU | Binario/librería compilado, apto para CPU |
| Hardware objetivo | GPU NVIDIA CUDA (3–6+ GB VRAM) | Funciona en CPU; aceleración GPU opcional |
| Streaming en tiempo real | Diseñado para ello, vía WebRTC | Posible con trabajo adicional del cliente |
| Integración de hardware | Diseñado como backend de Willow | Librería de uso general, sin vínculo a hardware |
| Ritmo de mantenimiento | Intermitente; último commit feb. 2026 | Mantenido activamente, commits frecuentes |
Si tu prioridad es un servidor listo para usar con streaming WebRTC y TTS integrados, y tienes una GPU NVIDIA disponible, el conjunto de funciones de Willow Inference Server es el más amplio de los dos. Si tu prioridad es la librería de transcripción más ligera posible, apta para CPU, para integrar en tu propia aplicación, vale la pena evaluar directamente whisper.cpp — consulta la reseña de whisper.cpp para todos los detalles.
¿Quién debería usar Willow Inference Server?
Que Willow Inference Server te encaje depende de si tienes una GPU NVIDIA compatible, si necesitas tanto ASR como TTS en un solo servidor, y si estás cómodo con un proyecto que publica actualizaciones en ráfagas en lugar de de forma continua.
Willow Inference Server vs. otras herramientas de voz
Willow Inference Server es una de varias opciones autoalojadas para el reconocimiento y la síntesis de voz local. Así se posiciona frente a otras herramientas de este ámbito — consulta el Directorio de Software de IA Local para el catálogo completo, y la comparación dedicada Willow Inference Server vs. whisper.cpp más arriba para el enfrentamiento directo más cercano.
- whisper.cpp — un port ligero en C/C++, apto para CPU, del Whisper de OpenAI, solo para transcripción, sin servidor integrado, WebRTC ni TTS; consulta la sección de comparación dedicada más arriba.
- Faster Whisper — una reimplementación de Whisper basada en CTranslate2, centrada en la velocidad de inferencia; una librería para integrar en lugar de un servidor ASR/TTS listo para usar como WIS.
- Piper TTS — un motor de texto a voz local ligero y apto para CPU; más limitado en alcance que el servidor combinado ASR+TTS de WIS, pero mucho más ligero en requisitos de hardware.
- Coqui TTS — un kit de herramientas de código abierto de texto a voz con soporte de clonación de voz, comparable en alcance TTS a la canalización XTTS integrada de WIS, pero distribuido como librería en lugar de servidor listo para WebRTC.
- Bark TTS — un modelo generativo de texto a voz capaz de producir audio no hablado (risas, pausas); una elección de motor TTS distinta a la canalización XTTS integrada de WIS.
- MacWhisper — una app de escritorio nativa de macOS para transcripción Whisper; una alternativa de escritorio con interfaz gráfica para usuarios que no necesitan en absoluto el modelo de despliegue servidor/WebRTC de WIS.
Errores comunes al evaluar Willow Inference Server
La mayor parte de la confusión sobre Willow Inference Server proviene de descripciones desactualizadas de su soporte de LLM, expectativas de hardware poco claras, o de sobrestimar cuán activamente publica actualizaciones en la actualidad.
Preguntas frecuentes
¿Qué es Willow Inference Server?
Willow Inference Server (WIS, github.com/toverainc/willow-inference-server) es un servidor gratuito, de código abierto y autoalojado que ejecuta reconocimiento de voz y texto a voz basados en Whisper, accesible mediante WebRTC, REST y WebSockets. Fue creado por Tovera como backend del proyecto de hardware del asistente de voz Willow.
¿Willow Inference Server es gratis?
Sí. El repositorio de GitHub no tiene página de precios, y su archivo LICENSE.md es la licencia Apache 2.0, aplicándose a toda la aplicación sin plan de pago. Aun así necesitas aportar y pagar tu propio hardware GPU para ejecutarlo.
¿Willow Inference Server admite inferencia LLM/chat?
No, no al momento de esta reseña. Un commit de febrero de 2026 eliminó el soporte general de LLM/chat del proyecto, y los mantenedores declararon: «We no longer support that. People can run ollama next to WIS.» Willow Inference Server es actualmente un servidor solo ASR/TTS.
¿Qué GPU necesita Willow Inference Server?
Una GPU NVIDIA compatible con CUDA. El proyecto documenta una GTX 1060 3 GB como mínimo práctico, con unos 6 GB de VRAM recomendados para ejecutar juntos los tres tamaños de modelo Whisper por defecto (base, medium, large-v2) más TTS. Existe una ruta Docker Compose solo para CPU, pero se documenta como notablemente más lenta.
¿Cómo instalo Willow Inference Server?
Clona el repositorio de GitHub y ejecuta docker compose up con el docker-compose.yml proporcionado para despliegue con GPU, o docker compose -f docker-compose-cpu.yml up para la ruta solo con CPU. Revisa el repositorio directamente para conocer las instrucciones actuales antes de instalar, ya que pueden cambiar entre commits.
¿Se mantiene activamente Willow Inference Server?
Su historial de commits muestra ráfagas de actividad separadas por brechas de varios meses en lugar de desarrollo continuo — por ejemplo, unos 14 meses sin commits públicos entre abril de 2024 y junio de 2025. Al momento de esta reseña, el commit más reciente en la rama principal es de febrero de 2026, y el repositorio no tiene versiones etiquetadas. No está archivado, pero es un proyecto más pequeño, con ritmo comunitario, en lugar de uno con una cadencia de lanzamientos continua.
¿Cuál es la relación entre Willow Inference Server y Willow?
Willow es un proyecto de hardware/firmware de código abierto separado, también mantenido por Tovera. Willow Inference Server es el software de backend que procesa la voz para los dispositivos Willow, pero también puede funcionar de forma independiente para otros casos de uso de voz a texto o texto a voz.
¿Puede Willow Inference Server clonar una voz personalizada para TTS?
Sí. Su canalización TTS integrada basada en XTTS admite la creación de un perfil de voz personalizado a partir de una grabación de muestra relativamente corta, según la documentación del proyecto.
¿Qué licencia usa Willow Inference Server?
La licencia Apache, versión 2.0, según el archivo LICENSE.md oficial — permisiva, con concesión de patentes y sin exigir publicar tus propias modificaciones como código abierto.
¿Willow Inference Server admite streaming en tiempo real?
Sí, mediante WebRTC, que el proyecto creó específicamente para casos de uso de audio en tiempo real de baja latencia, como un asistente de voz que escucha comandos de forma continua. También hay endpoints REST y WebSocket disponibles para integraciones sin streaming o más sencillas.