Skip to main content
PromptQuorum
Início/LLMs locais avançados/Ferramentas locais de voz e fala comparadas (2026): síntese de voz, transcrição e agentes de voz
Voice, Speech & Multimodal

Ferramentas locais de voz e fala comparadas (2026): síntese de voz, transcrição e agentes de voz

·9 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

As 17 ferramentas locais de voz do diretório PromptQuorum se dividem em três funções que devem ser comparadas separadamente: síntese de voz (8 ferramentas), transcrição de fala (7) e agentes de voz em tempo real (4). Na síntese de voz, a clonagem de voz consta na documentação oficial do Coqui TTS, do XTTS-v2, do Izwi e do Willow Inference Server; na transcrição, o whisper.cpp e o Willow Inference Server documentam transcrição em tempo real; e Dograh, Jarvis, Parlor e Voxa são os agentes de voz. Use a tabela comparativa abaixo e leia a análise de cada ferramenta antes de instalá-la.

As ferramentas locais de voz cumprem três funções diferentes — transformar texto em fala, transformar fala em texto e conduzir uma conversa falada com uma IA — e nenhuma lista única de recursos compara as três de forma justa. Este guia compara 17 ferramentas gratuitas e freemium que rodam no seu próprio hardware, uma função por vez, usando uma tabela comparativa gerada a partir dos mesmos dados da análise de cada ferramenta no PromptQuorum, de modo que a tabela e as análises não podem se contradizer.

Esta página contém links de referência para produtos de terceiros. O PromptQuorum não está inscrito em nenhum programa de afiliados — são links simples que não geram comissão. Clicar nos links e os próximos passos são de sua inteira responsabilidade. Estes links não representam qualquer endosso ou verificação por parte do PromptQuorum.

Principais conclusões

  • 17 ferramentas, três funções: síntese de voz (8), transcrição de fala (7), agentes de voz em tempo real (4). O Izwi e o Willow Inference Server fazem tanto síntese de voz quanto transcrição, por isso aparecem nas duas tabelas.
  • A tabela é gerada a partir do registro de cada ferramenta e conferida com o README ou o site oficial; um traço significa "não informado na documentação", nunca "não".
  • As licenças diferem de maneiras que importam: por exemplo, Piper e OpenAI Edge TTS são GPL-3.0, o Coqui TTS é MPL-2.0, o XTTS-v2 usa a Coqui Public Model License, e Bark, StyleTTS 2, whisper.cpp e faster-whisper são MIT.
  • Cada nome de ferramenta na tabela leva à sua própria análise no PromptQuorum, onde estão os passos de instalação e os limites.

📍 Em uma frase

As ferramentas locais de voz cumprem três funções diferentes — síntese de voz, transcrição de fala e agentes de voz em tempo real — por isso as 17 ferramentas do diretório PromptQuorum são comparadas dentro de cada função, usando uma tabela gerada a partir dos mesmos dados de ferramenta da análise de cada uma.

💬 Em termos simples

Algumas ferramentas leem texto em voz alta, outras escrevem o que você diz e outras conversam por voz com uma IA. Comparar um leitor com um transcritor em "clonagem de voz" não faz sentido, então este guia compara apenas o que é comparável.

Como comparamos

Os fatos de cada ferramenta — preço, licença, plataformas, requisitos de hardware e atributos específicos da categoria — são armazenados uma única vez, no registro da ferramenta no diretório. A tabela comparativa abaixo é gerada a partir desses registros, e a análise da própria ferramenta usa o mesmo registro, então as duas não podem informar valores diferentes.

Os atributos específicos da categoria (por exemplo, clonagem de voz ou transcrição em tempo real) foram tirados do README ou do site oficial de cada projeto e conferidos com a redação exata ali. Onde a documentação é omissa, a tabela mostra um traço em vez de adivinhar; onde uma afirmação vem com ressalvas (experimental, apenas em plano pago ou dependente de GPU), o atributo fica de fora da tabela e é tratado na análise da ferramenta.

A comparação lista ferramentas que rodam no seu próprio hardware. Ela não as classifica em ranking: qual é a certa depende da sua restrição, e as seções abaixo apontam onde estão as diferenças reais.

Tabela comparativa

Escolha uma função abaixo e leia ao longo de uma linha. Clique no nome de uma ferramenta para abrir a análise completa no PromptQuorum.

FerramentaPreçoLicençaPlataformasExecuçãoHardwareVersãoIdiomasClonagem de vozSaída em streamingUtilizável somente com CPUServidor de API localAnáliselink de produto · divulgado
BarkGratuitoMITmacOS, Windows, LinuxLocalCPU é suficiente13NãoLer análiseBark
Coqui TTSGratuitoMPL-2.0macOS, Windows, LinuxLocalCPU é suficientev0.27.5SimSimSimLer análiseCoqui TTS
IzwiGratuitoMITmacOS, Windows, LinuxLocalVaria conforme o modelov0.1.0-beta-17SimSimSimLer análiseIzwi
openai-edge-ttsGratuitoGPL-3.0macOS, Windows, LinuxHíbridoCPU é suficienteSimSimLer análiseopenai-edge-tts
Piper TTSGratuitoGPL-3.0macOS, Windows, LinuxLocalCPU é suficienteSimLer análisePiper TTS
StyleTTS 2GratuitoMITmacOS, Windows, LinuxLocalCPU é suficienteLer análiseStyleTTS 2
Willow Inference ServerGratuitoApache-2.0Linux, WindowsLocalCPU é suficienteSimSimSimLer análiseWillow Inference Server
XTTS v2GratuitoCPMLmacOS, Windows, LinuxLocal17SimLer análiseXTTS v2

"—" significa que a documentação do próprio projeto não informa o dado, não que o recurso não exista. Os valores vêm do README ou do site oficial de cada projeto e são conferidos novamente quando a análise de uma ferramenta é atualizada.

Síntese de voz: o que muda

  • Licença. Bark e StyleTTS 2 têm licença MIT. O Coqui TTS é MPL-2.0. O XTTS-v2 usa a Coqui Public Model License (CPML), uma licença personalizada com termos próprios, e não uma licença de código aberto padrão — leia-a antes de qualquer uso comercial. Piper e OpenAI Edge TTS são GPL-3.0, que impõe condições à distribuição de versões modificadas. Verifique a licença antes de construir um produto sobre qualquer uma delas — veja Piper TTS e XTTS v2.
  • Clonagem de voz. Coqui TTS (análise), XTTS-v2 (análise), Izwi (análise) e Willow Inference Server (análise) documentam clonagem de voz ou vozes personalizadas. O Bark informa que não oferece suporte à clonagem de voz personalizada.
  • Servidor de API local. Coqui TTS, Izwi, OpenAI Edge TTS, Piper e Willow Inference Server documentam um componente de servidor, para que outros aplicativos possam chamá-los por HTTP; o OpenAI Edge TTS é construído em torno disso.
  • Idiomas. O Bark documenta 13 idiomas e o XTTS-v2 documenta 17. As demais ferramentas não informam uma contagem comparável, por isso a tabela mostra um traço em vez de um número.

Transcrição de fala: o que muda

  • Transcrição em tempo real. O whisper.cpp documenta um exemplo de streaming em tempo real, e o Izwi e o Willow Inference Server documentam uso em tempo real. O faster-whisper é uma biblioteca de transcrição; seu próprio README não documenta um modo em tempo real.
  • Identificação de falantes. Izwi e FunClip documentam a identificação de falantes. O Meetily oferece diarização de falantes apenas no plano Pro pago. A marcação de troca de falantes do whisper.cpp é experimental e é tratada na análise dele, não na tabela.
  • Preço e plataforma. O MacWhisper é um aplicativo proprietário para macOS com um plano gratuito e uma atualização paga; a maioria das outras ferramentas aqui é gratuita e de código aberto. A Community Edition do Meetily é gratuita e sob licença MIT, com um plano Pro pago.
  • Servidor de API local. O whisper.cpp inclui um servidor, e o Izwi e o Willow Inference Server documentam APIs HTTP.

Agentes de voz: o que muda

  • Totalmente local versus nuvem opcional. O Jarvis documenta uma pilha local de entrada de voz, LLM e saída de voz; o Parlor documenta um pipeline local com um recurso opcional de pesquisa na nuvem. O Voxa pode usar um provedor de voz local ou provedores na nuvem, então só é totalmente local se você escolher o local.
  • Interrupção (barge-in). Jarvis, Parlor e Voxa documentam que você pode interromper o agente enquanto ele fala.
  • Seu próprio LLM e chamadas telefônicas. O Dograh documenta a escolha do LLM e integrações de telefonia; o Voxa documenta a conexão do seu próprio modelo por meio de um daemon local.

O que esta comparação não pode dizer

  • Ela compara capacidades documentadas, não qualidade. Não diz nada sobre o quão natural uma voz soa ou o quão preciso é uma transcrição — isso exige o seu próprio áudio e o seu próprio hardware.
  • Ela não inclui benchmarks de velocidade: o PromptQuorum não os mediu para essas ferramentas.
  • Os traços são lacunas na documentação dos projetos, não constatações negativas. Algumas ferramentas podem oferecer um recurso que o README não menciona.
  • As ferramentas mudam rapidamente. A análise de cada ferramenta informa a versão com a qual foi conferida, e este guia é atualizado quando uma análise é atualizada.

Perguntas frequentes

Por que síntese de voz, transcrição de fala e agentes de voz são comparados separadamente?

Elas cumprem funções diferentes, então a maioria dos atributos só faz sentido dentro de uma função — clonagem de voz se aplica à síntese de voz, identificação de falantes à transcrição, interrupção aos agentes de voz. Compará-las em uma única tabela deixaria a maioria das células vazia ou sem sentido.

O que significa um traço na tabela comparativa?

Significa que a documentação do próprio projeto não informa esse atributo. Não significa que o recurso não exista; consulte a análise da ferramenta ou o repositório dela.

Essas ferramentas são realmente locais?

Elas foram projetadas para rodar no seu próprio hardware, mas algumas oferecem recursos opcionais na nuvem — por exemplo, a pesquisa opcional na nuvem do Parlor ou os provedores de voz na nuvem do Voxa — e algumas precisam de internet na primeira execução para baixar modelos. A análise de cada ferramenta trata disso.

Alguma dessas ferramentas tem link de afiliado?

Não. O PromptQuorum não tem relação de afiliado com nenhuma ferramenta desta comparação no momento em que este texto foi escrito, e nenhum link aqui gera comissão.

Com que frequência esta comparação é atualizada?

Ela é atualizada duas vezes por ano e sempre que a análise de uma das ferramentas listadas é atualizada, porque a tabela é gerada a partir dos mesmos dados dessas análises.

Fontes

← Voltar para LLMs locais avançados