Principais conclusões
- O Willow Inference Server é gratuito e de código aberto; a LICENSE oficial no GitHub é a licença Apache 2.0
- Executa reconhecimento automático de voz (ASR) e texto em voz (TTS) baseados em Whisper, acessíveis via WebRTC, REST e WebSockets
- Implantado via Docker Compose no Linux (Windows via WSL); também é fornecido um arquivo Docker Compose apenas para CPU, embora o desempenho em CPU seja documentado como significativamente mais lento que em GPU
- Roda em GPUs NVIDIA desde a GTX 1060 3 GB até a RTX 4090; cerca de 6 GB de VRAM são recomendados para rodar todos os tamanhos padrão de modelo Whisper junto com o TTS
- Suporta a criação de vozes TTS personalizadas a partir de uma gravação de amostra relativamente curta
- Desenvolvido pela Tovera como backend do projeto de hardware de código aberto do assistente de voz Willow
- Não suporta mais inferência LLM/chat geral — esse recurso foi explicitamente removido em um commit de fevereiro de 2026; os próprios mantenedores do projeto orientam os usuários a rodar uma ferramenta separada, como o Ollama, em paralelo para essa necessidade
- O repositório no GitHub (github.com/toverainc/willow-inference-server) mostra cerca de 510 estrelas em setembro de 2026; a atividade de commits acontece em rajadas em vez de contínua — considere este um projeto menor e mais lento do que um projeto comercial com equipe extensa
📍 Em uma frase
O Willow Inference Server é um servidor gratuito, de código aberto e auto-hospedado que executa reconhecimento de voz baseado em Whisper e texto em voz na sua própria GPU NVIDIA, sem nenhum plano pago.
💬 Em termos simples
Em vez de enviar suas gravações de voz para uma API de voz na nuvem, o Willow Inference Server executa os modelos de voz para texto e texto para voz em um computador que você controla, geralmente equipado com uma placa gráfica NVIDIA. Ele foi criado para alimentar o projeto de hardware do assistente de voz Willow, mas pode funcionar sozinho para qualquer aplicativo que precise transformar voz em texto ou texto em voz sem depender da nuvem.
📌Nota: Esta análise é o complemento aprofundado da ficha do Willow Inference Server no Diretório de Software de IA Local — veja essa página para comparar rapidamente com dezenas de outras ferramentas de IA local.
O que é o Willow Inference Server?
O Willow Inference Server é um servidor auto-hospedado que executa modelos de reconhecimento e síntese de voz no seu próprio hardware, acessível via WebRTC, REST e WebSockets. Sua própria descrição no GitHub diz: "Open source, local, and self-hosted highly optimized language inference server supporting ASR/STT, TTS, and LLM across WebRTC, REST, and WS" — uma descrição que esta análise considera agora parcialmente desatualizada, já que o suporte geral a LLM foi removido do código em fevereiro de 2026 (veja a seção de histórico abaixo). No momento desta análise, o WIS é descrito com precisão como um servidor ASR/TTS, não como um servidor LLM geral.
- Função principal: um servidor de inferência de voz que aceita áudio ou texto via WebRTC, REST ou WebSockets e retorna texto transcrito ou áudio sintetizado
- Motor de reconhecimento de voz: modelos Whisper da OpenAI, ajustados pelo projeto para transmissão de baixa latência
- Motor de texto em voz: um pipeline de TTS integrado (o repositório inclui um
Dockerfile.xttse um diretórioxttsdedicados), com suporte para criar vozes personalizadas a partir de gravações de amostra curtas - Alvo de implantação: GPUs NVIDIA compatíveis com CUDA, com um caminho de fallback apenas para CPU documentado para desempenho menor
- Desenvolvedor: Tovera, a organização por trás do projeto de hardware de código aberto do assistente de voz Willow
- Repositório canônico: github.com/toverainc/willow-inference-server — o nome de projeto e organização atualmente em uso ativo para o código-fonte, as versões e o rastreamento de problemas do servidor
Histórico do projeto Willow Inference Server
O repositório no GitHub do Willow Inference Server foi criado em fevereiro de 2023, e seu histórico de commits mostra picos de atividade separados por longos períodos de calmaria, em vez de um desenvolvimento semanal contínuo — um padrão que vale a pena conhecer antes de depender dele em produção.
- 1Fevereiro de 2023 — Repositório criado
Why it matters: O Willow Inference Server começou como complemento de backend do projeto de hardware do assistente de voz Willow, que a organização Tovera também mantém. - 2Abril de 2024 — Atualizações do motor de TTS
Why it matters: Os commits desse período atualizaram o pipeline de clonagem de voz XTTS integrado, segundo o histórico de commits do repositório. - 3Junho de 2025 — Revisão de qualidade de código
Why it matters: Um lote de commits substituiu a verificação flake8 do projeto pela formatação de código black e reformatou a base de código Python — uma revisão de manutenção, não um lançamento de recurso, após cerca de 14 meses sem commits públicos. - 4Fevereiro de 2026 — Remoção do suporte a LLM/chat
Why it matters: Um commit intitulado "README: drop LLM/chat references" declara claramente: "We no longer support that. People can run ollama next to WIS." Esta é a mudança mais significativa na história recente do projeto — ela reduz o escopo do WIS de um servidor combinado ASR/TTS/LLM para um servidor apenas ASR/TTS, e é o commit mais recente na branch principal do repositório no momento desta análise.
O que você pode fazer com o Willow Inference Server?
O conjunto de recursos do Willow Inference Server é focado em processamento de voz rápido e auto-hospedado, em vez de chat com modelo de linguagem de propósito geral. Aqui está o que cada parte realmente faz, segundo o próprio README no GitHub do projeto.
- Reconhecimento automático de voz (ASR) — transcreve áudio falado em texto usando modelos baseados em Whisper, ajustados pelo projeto para um reconhecimento em streaming "o mais próximo possível do tempo real", em vez de apenas transcrição em lote
- Múltiplos tamanhos de modelo Whisper simultâneos — o README afirma que os três tamanhos padrão de modelo Whisper (base, medium, large-v2) podem ser carregados simultaneamente dentro de 6 GB de VRAM, permitindo que uma implantação equilibre precisão e velocidade por requisição, em vez de se comprometer com um único tamanho de modelo
- Texto em voz (TTS) com clonagem de voz — sintetiza voz a partir de texto, com suporte para criar uma voz personalizada a partir de uma gravação de amostra relativamente curta, via o pipeline integrado baseado em XTTS
- Acesso multiprotocolo — acessível via WebRTC (para streaming de áudio em tempo real com baixa largura de banda), REST e WebSockets, para que um cliente possa escolher o transporte que melhor se adapte ao seu caso de uso
- Detecção automática de hardware — o servidor é documentado como capaz de detectar automaticamente o hardware disponível e ajustar seu comportamento de acordo, em vez de exigir configuração manual para cada modelo de GPU
- Backend do assistente de voz Willow — o WIS é o backend de inferência ao qual o projeto de hardware de código aberto do assistente de voz Willow se conecta para transformar comandos falados em texto e, opcionalmente, respostas de volta em voz
Exemplos de uso: três formas de usar o Willow Inference Server
Estes são fluxos de trabalho concretos construídos a partir dos recursos documentados do Willow Inference Server acima — não casos de uso hipotéticos.
Instalar o Willow Inference Server
O Willow Inference Server é instalado via Docker Compose, e seu código-fonte está no GitHub. Os links e comandos abaixo vêm do repositório oficial no GitHub — sempre verifique diretamente nessa página, já que as instruções de instalação podem mudar entre commits.
Repositório GitHub (código-fonte, Apache 2.0)
Clonar o repositório
- Link:
git clone https://github.com/toverainc/willow-inference-server.git
Implantação com GPU
- Link:
docker compose upusando odocker-compose.ymldo repositório
Implantação apenas com CPU
- Link:
docker compose -f docker-compose-cpu.yml up(documentado como significativamente mais lento que com GPU)
Projeto assistente de voz Willow
- Link:
- github.com/toverainc — os demais repositórios da organização-mãe, incluindo o projeto de hardware/firmware Willow para o qual o WIS foi originalmente criado
O Willow Inference Server precisa de uma GPU NVIDIA compatível com CUDA para atingir os números de desempenho documentados — uma GTX 1060 3 GB é o mínimo indicado, com cerca de 6 GB de VRAM recomendados para rodar ASR e TTS juntos. Existe um caminho de Docker Compose apenas para CPU, documentado no repositório, mas o projeto indica que o desempenho em CPU fica bem atrás de qualquer uma das GPUs listadas; considere o modo apenas CPU como um fallback funcional para testes, não como um alvo de implantação em produção.
Preços do Willow Inference Server: é realmente gratuito?
Sim — o Willow Inference Server não tem nenhum plano pago. O repositório no GitHub não tem página de preços, e o arquivo LICENSE.md se aplica a toda a aplicação. O texto da licença é a Apache License, versão 2.0 — permissiva, com concessão de patente e sem obrigação de copyleft de publicar suas próprias modificações.
- Sem assinatura, sem plano pago, sem limites de uso impostos pelo próprio Willow Inference Server
- Não é necessária conta ou cadastro para implantar ou usar o software
- Rodar o WIS ainda exige seu próprio hardware de GPU e o custo de eletricidade/hospedagem para operá-lo — o software em si é gratuito, mas a auto-hospedagem não tem custo zero como pode ter uma API hospedada
- A Tovera também opera um servidor de exemplo hospedado para o projeto de hardware separado do assistente de voz Willow — esta análise cobre especificamente o software WIS auto-hospedado e gratuito para rodar; verifique diretamente com a Tovera quaisquer detalhes sobre uma oferta hospedada separada e se ela tem custo próprio
Willow Inference Server vs. whisper.cpp
O Willow Inference Server e o whisper.cpp executam ambos os modelos de reconhecimento de voz Whisper da OpenAI localmente, e são comparados com frequência porque nenhum dos dois envia áudio para uma API na nuvem. As diferenças mais claras estão no modelo de implantação e no escopo.
Aspecto | WIS | whisper.cpp |
|---|---|---|
| Escopo | Servidor ASR + TTS com WebRTC/REST/WS | Apenas ASR (transcrição), sem servidor/TTS |
| Implantação | Docker Compose, focado em GPU | Binário/biblioteca compilado, amigável à CPU |
| Hardware-alvo | GPU NVIDIA CUDA (3–6+ GB VRAM) | Roda em CPU; aceleração GPU opcional |
| Streaming em tempo real | Construído para isso, via WebRTC | Possível com trabalho extra do cliente |
| Integração de hardware | Construído como backend do Willow | Biblioteca de propósito geral, sem vínculo a hardware |
| Ritmo de manutenção | Em rajadas; último commit fev. 2026 | Mantido ativamente, commits frequentes |
Se sua prioridade é um servidor pronto para uso com streaming WebRTC e TTS integrados, e você tem uma GPU NVIDIA disponível, o conjunto de recursos do Willow Inference Server é o mais amplo dos dois. Se sua prioridade é a biblioteca de transcrição mais leve possível e amigável à CPU para incorporar em seu próprio aplicativo, vale a pena avaliar diretamente o whisper.cpp — veja a análise do whisper.cpp para todos os detalhes.
Quem deveria usar o Willow Inference Server?
O fato de o Willow Inference Server se encaixar ou não depende de você ter uma GPU NVIDIA compatível, precisar de ASR e TTS em um único servidor, e estar confortável com um projeto que lança atualizações em rajadas em vez de continuamente.
Willow Inference Server vs. outras ferramentas de voz
O Willow Inference Server é uma entre várias opções auto-hospedadas para reconhecimento e síntese de voz locais. Veja como ele se posiciona em relação a outras ferramentas nesse espaço — consulte o Diretório de Software de IA Local para o catálogo completo, e a comparação dedicada Willow Inference Server vs. whisper.cpp acima para o confronto mais direto.
- whisper.cpp — uma portabilidade leve e amigável à CPU do Whisper da OpenAI em C/C++, apenas para transcrição, sem servidor integrado, WebRTC ou TTS; veja a seção de comparação dedicada acima.
- Faster Whisper — uma reimplementação do Whisper baseada em CTranslate2, focada em velocidade de inferência; uma biblioteca para incorporar, em vez de um servidor ASR/TTS pronto para uso como o WIS.
- Piper TTS — um motor de texto para voz local leve e amigável à CPU; mais restrito em escopo que o servidor combinado ASR+TTS do WIS, mas bem mais leve em requisitos de hardware.
- Coqui TTS — um kit de ferramentas de texto para voz de código aberto com suporte a clonagem de voz, comparável em escopo de TTS ao pipeline XTTS empacotado pelo WIS, mas distribuído como biblioteca em vez de servidor pronto para WebRTC.
- Bark TTS — um modelo generativo de texto para voz capaz de produzir áudio não falado (risadas, pausas); uma escolha de motor de TTS diferente do pipeline XTTS empacotado pelo WIS.
- MacWhisper — um aplicativo de desktop nativo para macOS para transcrição Whisper; uma alternativa de desktop com interface gráfica para usuários que não precisam do modelo de implantação servidor/WebRTC do WIS de forma alguma.
Erros comuns ao avaliar o Willow Inference Server
A maior parte da confusão em torno do Willow Inference Server vem de descrições desatualizadas do seu suporte a LLM, expectativas de hardware pouco claras, ou de superestimar o quão ativamente ele lança atualizações atualmente.
Perguntas frequentes
O que é o Willow Inference Server?
O Willow Inference Server (WIS, github.com/toverainc/willow-inference-server) é um servidor gratuito, de código aberto e auto-hospedado que executa reconhecimento de voz e texto em voz baseados em Whisper, acessível via WebRTC, REST e WebSockets. Foi desenvolvido pela Tovera como backend do projeto de hardware do assistente de voz Willow.
O Willow Inference Server é gratuito?
Sim. O repositório no GitHub não tem página de preços, e seu arquivo LICENSE.md é a licença Apache 2.0, aplicando-se a toda a aplicação sem plano pago. Você ainda precisa fornecer e pagar seu próprio hardware de GPU para rodá-lo.
O Willow Inference Server suporta inferência LLM/chat?
Não, não no momento desta análise. Um commit de fevereiro de 2026 removeu o suporte geral a LLM/chat do projeto, com os mantenedores declarando: "We no longer support that. People can run ollama next to WIS." O Willow Inference Server é atualmente um servidor apenas ASR/TTS.
De qual GPU o Willow Inference Server precisa?
Uma GPU NVIDIA compatível com CUDA. O projeto documenta uma GTX 1060 3 GB como o mínimo prático, com cerca de 6 GB de VRAM recomendados para rodar os três tamanhos padrão de modelo Whisper (base, medium, large-v2) junto com o TTS. Existe um caminho de Docker Compose apenas para CPU, mas documentado como significativamente mais lento.
Como instalo o Willow Inference Server?
Clone o repositório no GitHub e execute docker compose up com o docker-compose.yml fornecido para implantação com GPU, ou docker compose -f docker-compose-cpu.yml up para o caminho apenas com CPU. Verifique o repositório diretamente para instruções atuais antes de instalar, já que podem mudar entre commits.
O Willow Inference Server é mantido ativamente?
Seu histórico de commits mostra picos de atividade separados por lacunas de vários meses, em vez de desenvolvimento contínuo — por exemplo, cerca de 14 meses sem commits públicos entre abril de 2024 e junho de 2025. No momento desta análise, o commit mais recente na branch principal é de fevereiro de 2026, e o repositório não tem versões com tag. Ele não está arquivado, mas é um projeto menor, com ritmo de comunidade, em vez de um com cadência de lançamento contínua.
Qual é a relação entre o Willow Inference Server e o Willow?
O Willow é um projeto de hardware/firmware de código aberto separado para assistente de voz, também mantido pela Tovera. O Willow Inference Server é o software de backend que processa a voz para os dispositivos Willow, mas também pode rodar de forma independente para outros casos de uso de voz para texto ou texto para voz.
O Willow Inference Server pode clonar uma voz personalizada para TTS?
Sim. Seu pipeline de TTS integrado baseado em XTTS suporta a criação de um perfil de voz personalizado a partir de uma gravação de amostra relativamente curta, segundo a documentação do projeto.
Qual licença o Willow Inference Server usa?
A Apache License, versão 2.0, segundo o arquivo LICENSE.md oficial — permissiva, com concessão de patente e sem exigir que você publique suas próprias modificações como código aberto.
O Willow Inference Server suporta streaming em tempo real?
Sim, via WebRTC, que o projeto construiu especificamente para casos de uso de áudio em tempo real com baixa latência, como um assistente de voz que fica ouvindo comandos continuamente. Endpoints REST e WebSocket também estão disponíveis para integrações sem streaming ou mais simples.