Skip to main content
PromptQuorum
Início/LLMs locais avançados/Piper vs Kokoro TTS (2026): Qual Mecanismo de Voz Local Usar?
Voice, Speech & Multimodal

Piper vs Kokoro TTS (2026): Qual Mecanismo de Voz Local Usar?

·11 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

Use o Piper se precisar, das duas opções, do mecanismo de texto para voz local mais rápido e mais leve em recursos — ele roda em tempo real em um Raspberry Pi sem GPU. Use o Kokoro se a qualidade de voz importar mais do que a velocidade pura — seu modelo de 82 milhões de parâmetros produz áudio perceptivelmente mais natural mesmo rodando em CPU. O Piper tem licença GPL-3.0-or-later (seu repositório original arquivado era MIT); o Kokoro tem licença Apache-2.0. Nenhum dos dois clona vozes a partir de um clipe de amostra — ambos oferecem um conjunto fixo de vozes pré-treinadas. Para clonagem de voz, consulte a análise do XTTS v2 da PromptQuorum.

Piper e Kokoro são dois mecanismos de texto para voz (TTS) de peso aberto e totalmente locais que resolvem problemas diferentes: o Piper, criado originalmente dentro do projeto de assistente de voz Rhasspy e hoje mantido pela Open Home Foundation em OHF-Voice/piper1-gpl, é a opção mais rápida e mais leve em recursos das duas, rodando tranquilamente em um Raspberry Pi sem GPU. O Kokoro, um modelo de 82 milhões de parâmetros lançado pelo desenvolvedor pseudônimo hexgrad, troca parte dessa eficiência bruta por um áudio perceptivelmente mais natural, em um modelo que ainda é pequeno o suficiente para rodar em CPU. Nenhum dos dois clona vozes a partir de uma amostra de áudio curta — ambos oferecem um conjunto fixo de vozes pré-treinadas. Esta comparação cobre comandos de instalação reais, licenças atuais, requisitos de hardware e qual escolher para cada uso.

Piper vs Kokoro TTS (2026): Qual Mecanismo de Voz Local Usar?

Principais conclusões

  • Piper: originado no ecossistema Rhasspy/Home Assistant, hoje mantido pela Open Home Foundation; baseado em ONNX Runtime; roda tranquilamente em um Raspberry Pi sem GPU.
  • Kokoro: um modelo de 82 milhões de parâmetros por hexgrad, derivado de StyleTTS2 e ISTFTNet, licença Apache-2.0; roda bem em CPU ou GPU modesta.
  • Nenhum dos dois mecanismos realiza clonagem de voz zero-shot; ambos oferecem conjuntos fixos de vozes pré-treinadas.
  • Licença do Piper: GPL-3.0-or-later (repositório atual); o repositório original arquivado era MIT. Licença do Kokoro: Apache-2.0.
  • O Piper vence em velocidade pura e uso mínimo de recursos; o Kokoro é amplamente descrito como mais natural em comparações de escuta da comunidade.
  • Use o Piper para dispositivos embarcados/de borda e assistentes de voz; use o Kokoro quando a qualidade de áudio importar mais do que caber no menor hardware possível.

📍 Em uma frase

O Piper é o mecanismo de texto para voz local mais rápido e leve, que roda em um Raspberry Pi sem GPU (licença GPL-3.0-or-later), enquanto o Kokoro é um modelo de peso aberto com 82 milhões de parâmetros (Apache-2.0) que troca um pouco de velocidade por áudio perceptivelmente mais natural; nenhum dos dois clona vozes a partir de uma amostra.

💬 Em termos simples

Ambos transformam texto em áudio falado inteiramente no seu próprio computador, sem chamada a uma API na nuvem. O Piper é menor e mais rápido, por isso funciona em hardware barato como um Raspberry Pi, mas soa um pouco mais robótico. O Kokoro é um modelo um pouco maior que soa perceptivelmente mais humano, ao custo de precisar de um pouco mais de poder de processamento.

📌Nota: Nem o Piper nem o Kokoro clonam uma voz a partir de um clipe de referência curto. Para essa capacidade, veja a análise do XTTS v2 da PromptQuorum — note que a licença do XTTS v2 é não comercial, diferente do Piper e do Kokoro.

O que cada mecanismo realmente é

Piper e Kokoro resolvem o mesmo problema básico — transformar texto em áudio falado em hardware local, sem que os dados saiam da máquina —, mas vêm de linhagens diferentes e fazem trocas diferentes entre tamanho e qualidade.

  • O Piper é um mecanismo de texto para voz neural, criado originalmente por Michael Hansen dentro do Rhasspy, um kit de ferramentas open source para assistentes de voz offline. Ele converte texto em fonemas com o espeak-ng e depois sintetiza uma forma de onda a partir desses fonemas usando um modelo no estilo VITS exportado para o ONNX Runtime para inferência rápida, inclusive em hardware somente CPU. Tornou-se o mecanismo TTS local padrão no pipeline de voz do Home Assistant e hoje é mantido pela Open Home Foundation em OHF-Voice/piper1-gpl. A PromptQuorum cobre o assunto em detalhes em uma análise dedicada ao Piper.
  • O Kokoro é um modelo TTS de peso aberto com 82 milhões de parâmetros, lançado no Hugging Face pelo desenvolvedor conhecido como hexgrad. Sua arquitetura é baseada no StyleTTS 2 com um vocoder ISTFTNet, em um design apenas de decodificador sem etapa de difusão — um pipeline menor e mais simples do que muitos modelos TTS com maior número de parâmetros. Segundo seu model card no Hugging Face, foi treinado com algumas centenas de horas de áudio de licença permissiva ou de domínio público, e a versão 1.0 foi lançada em 27 de janeiro de 2025.
  • Nenhum dos dois modelos clona uma voz a partir de um clipe de referência curto. Piper e Kokoro oferecem cada um um conjunto fixo de vozes pré-treinadas entre as quais você escolhe — uma capacidade fundamentalmente diferente de um modelo de clonagem de voz como o XTTS v2, que sintetiza fala em uma nova voz a partir de 6 segundos de áudio de amostra, ainda que sob licença não comercial.
  • Ambos rodam totalmente offline, no seu próprio hardware. Nem texto nem áudio são enviados a uma API na nuvem por nenhum dos dois mecanismos — todo o pipeline de síntese roda localmente, o que importa para aplicações sensíveis à privacidade e para evitar custos de TTS em nuvem cobrados por caractere.

Piper vs Kokoro: comparação lado a lado

O Piper vence em velocidade e mínimo uso de hardware; o Kokoro vence em qualidade de áudio percebida. A tabela abaixo resume as trocas reais — trate a linha "Qualidade de voz" como uma impressão qualitativa e amplamente relatada pela comunidade, não como uma pontuação de benchmark específica, já que a PromptQuorum não conseguiu localizar um único benchmark numérico e confiável que compare os dois diretamente.

Origem / mantenedor

Piper:
Projeto Rhasspy → Open Home Foundation
Kokoro:
Desenvolvedor independente (hexgrad)

Número de parâmetros

Piper:
Nenhum número único divulgado (estilo VITS, modelos por voz)
Kokoro:
82 milhões de parâmetros

Arquitetura

Piper:
Estilo VITS, ONNX Runtime
Kokoro:
StyleTTS 2 + ISTFTNet, apenas decodificador

Licença

Piper:
GPL-3.0-or-later (repositório atual)
Kokoro:
Apache-2.0

Requisitos de hardware

Piper:
Somente CPU, tempo real em um Raspberry Pi
Kokoro:
CPU ou GPU modesta

Qualidade de voz (relatos da comunidade)

Piper:
Rápido, bom para seu tamanho, mais robótico
Kokoro:
Amplamente descrito como mais natural / expressivo

Clonagem de voz

Piper:
Não — vozes pré-treinadas fixas
Kokoro:
Não — vozes pré-treinadas fixas

Instalação

Piper:
pip install piper-tts
Kokoro:
pip install kokoro

Exemplos reais de uso

Esses comandos usam o padrão de instalação e API documentado por cada projeto. Verifique a documentação atual no GitHub/Hugging Face de cada projeto antes de implantar, já que flags de CLI e nomes de pacotes podem mudar entre versões.

  • O Piper inicia mais rápido. Seus modelos ONNX por voz carregam rapidamente e a síntese é quase instantânea em CPU, motivo pelo qual é a escolha comum para assistentes de voz interativos em hardware limitado.
  • O pipeline do Kokoro agrupa a síntese em blocos (a tupla gs/ps/audio acima), algo bom de saber antes de presumir que uma única chamada retorna um buffer de áudio contínuo para textos longos.
python
# ── Piper: instalação e síntese ────────────────────────────────
pip install piper-tts
python3 -m piper.download_voices en_US-lessac-medium
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."

# API Python do Piper
from piper import PiperVoice
voice = PiperVoice.load("en_US-lessac-medium.onnx")
with open("test.wav", "wb") as wav_file:
    voice.synthesize_wav("Fast, local speech synthesis.", wav_file)

# ── Kokoro: instalação e síntese ───────────────────────────────
pip install kokoro soundfile

# API Python do Kokoro (conforme hexgrad/Kokoro-82M no Hugging Face)
from kokoro import KPipeline
import soundfile as sf

pipeline = KPipeline(lang_code="a")  # "a" = inglês americano
generator = pipeline(
    "Kokoro produces noticeably natural-sounding speech from a small model.",
    voice="af_heart",
)
for i, (gs, ps, audio) in enumerate(generator):
    sf.write(f"output_{i}.wav", audio, 24000)

Licença e custo

O repositório ativamente mantido do Piper, OHF-Voice/piper1-gpl, tem licença GPL-3.0-or-later. Essa é uma mudança em relação ao repositório original rhasspy/piper, que era licenciado sob MIT antes de ser arquivado (tornado somente leitura) em 6 de outubro de 2025, e continua disponível sob essa licença MIT, mas sem manutenção. A GPL-3.0 é uma licença copyleft: você pode usar o Piper gratuitamente, inclusive comercialmente, para gerar fala, mas se distribuir uma versão modificada do próprio código-fonte do Piper, deve publicar essa modificação sob os mesmos termos da GPL-3.0. Usar o Piper como ferramenta externa não modificada (sua CLI, seu pacote Python, ou um servidor web chamado como processo separado) geralmente não coloca o restante da sua aplicação sob a GPL, mas o limite exato depende de quão estreitamente seu código está vinculado ao código do Piper — isso não é aconselhamento jurídico; consulte um advogado para sua implantação específica.

O Kokoro tem licença Apache-2.0, confirmada em seu model card no Hugging Face. A Apache-2.0 é uma licença permissiva sem obrigações de copyleft — você pode usar, modificar e redistribuir o Kokoro, inclusive em produtos comerciais de código fechado, sem ser obrigado a publicar seu próprio código-fonte, sujeito aos termos padrão de atribuição e concessão de patente da licença.

Nenhum dos dois mecanismos tem camada paga, assinatura ou taxa de licença. Os únicos custos são o hardware em que você os executa e seu próprio tempo de desenvolvimento. Se você quer, em vez disso, uma API TTS em nuvem gerenciada e paga com clonagem de voz comercial, veja a comparação ElevenLabs vs TTS local da PromptQuorum.

O Kokoro TTS é gratuito para uso comercial?

Sim. O Kokoro tem licença Apache-2.0, uma licença permissiva sem obrigações de copyleft, então pode ser usado em produtos comerciais de código fechado sem a necessidade de publicar seu próprio código-fonte, sujeito aos termos padrão de atribuição e concessão de patente da licença. Isso não é aconselhamento jurídico — leia a licença Apache-2.0 você mesmo antes de uma implantação comercial.

O Piper é gratuito para uso comercial?

Sim, gerar fala com o Piper é gratuito para uso comercial. Sua licença atual, GPL-3.0-or-later, é uma licença copyleft que só impõe condições se você distribuir uma versão modificada do próprio código-fonte do Piper — usá-lo como ferramenta externa geralmente não coloca o restante do código da sua aplicação sob a GPL. Isso não é aconselhamento jurídico — consulte um advogado para sua implantação específica.

Quem deve usar qual

Escolha o Piper para dispositivos embarcados, assistentes de voz e qualquer implantação em que os ciclos de CPU ou a memória sejam fortemente limitados. Escolha o Kokoro quando a qualidade de áudio for a prioridade e você tiver pelo menos um orçamento modesto de CPU ou GPU para investir nisso.

  • Escolha o Piper se: você está rodando em um Raspberry Pi ou dispositivo similarmente limitado, precisa da menor latência possível até o primeiro áudio, ou está integrando com o pipeline de voz do Home Assistant, onde o Piper é o mecanismo TTS local padrão.
  • Escolha o Kokoro se: você está produzindo audiolivros, narrações, ou qualquer conteúdo em que os ouvintes notariam fala robótica, e você tem margem de CPU ou GPU além do mínimo absoluto.
  • Não escolha nenhum dos dois, e veja o XTTS v2 em vez disso, se: você precisa clonar a voz de uma pessoa específica a partir de um clipe de referência curto — tanto o Piper quanto o Kokoro usam apenas vozes pré-treinadas fixas, e nenhum dos dois realiza clonagem de voz. Veja a análise do XTTS v2 da PromptQuorum (licença não comercial) ou o guia de licenças de TTS local para alternativas com clonagem e suas licenças.
  • Não escolha nenhum dos dois, e veja a comparação com o ElevenLabs em vez disso, se: você precisa de clonagem de voz de nível comercial com licença paga clara e não quer autogerenciar a hospedagem. Veja a comparação ElevenLabs vs TTS local da PromptQuorum.

Para o que nenhum dos dois serve

Piper e Kokoro são ambos mecanismos TTS de voz fixa, sem clonagem. Nenhum dos dois é a ferramenta certa para as seguintes situações:

  • Clonar a voz de uma pessoa específica a partir de um clipe de amostra. Ambos os mecanismos oferecem apenas vozes pré-treinadas — não há mecanismo em nenhum dos dois para gerar fala em uma voz nova, nunca ouvida antes, a partir de uma gravação de referência curta. Veja o XTTS v2 em vez disso, observando sua licença não comercial.
  • Áudio expressivo e emocional, não vocal (risadas, suspiros, som ambiente). Ambos os mecanismos sintetizam fala, não a gama mais ampla de áudio expressivo que um modelo como o Bark visa.
  • A máxima fidelidade de áudio possível, independentemente do custo em recursos. Para leitores que especificamente querem a narração em inglês de mais alta qualidade e não têm restrição de recursos, a análise do StyleTTS 2 da PromptQuorum cobre um modelo com arquitetura subjacente comparável ao Kokoro, mas uma troca de tamanho/qualidade diferente.
  • Uma base de código GPL-3.0 dentro de um produto de código fechado que modifica o próprio código-fonte do Piper. Se seu plano de implantação envolve fazer fork ou vincular estaticamente código-fonte modificado do Piper em um binário de código fechado, a licença GPL-3.0-or-later atual do Piper é uma restrição real — a licença Apache-2.0 do Kokoro não tem essa restrição.

Alternativas

XTTS v2

Melhor para:
Clonagem de voz a partir de 6 segundos de áudio de referência
Licença:
CPML (não comercial)

Kit de ferramentas Coqui TTS

Melhor para:
O software que executa o XTTS v2 e outros modelos
Licença:
MPL-2.0 (somente o kit)

Bark

Melhor para:
Áudio expressivo, não vocal — risadas, suspiros, som ambiente
Licença:
MIT

StyleTTS 2

Melhor para:
A narração em inglês mais natural (sem clonagem de voz)
Licença:
MIT

ElevenLabs

Melhor para:
API em nuvem gerenciada com clonagem de voz comercial
Licença:
Proprietária (API em nuvem paga)

Perguntas frequentes

Qual é a principal diferença entre o Piper e o Kokoro TTS?

O Piper é um mecanismo TTS neural leve e totalmente local, otimizado para velocidade e uso mínimo de recursos — roda em tempo real em hardware somente CPU, incluindo um Raspberry Pi. O Kokoro é um modelo de peso aberto com 82 milhões de parâmetros que produz áudio perceptivelmente mais natural, ao custo de precisar de um pouco mais de poder de processamento, embora ainda rode em CPU ou GPU modesta.

Qual soa mais natural, o Piper ou o Kokoro?

O Kokoro é amplamente relatado como mais natural do que o Piper em comparações de escuta da comunidade. A PromptQuorum não conseguiu localizar um único benchmark numérico confiável e verificado de forma independente comparando os dois mecanismos diretamente — trate isso, portanto, como uma impressão qualitativa e amplamente relatada pela comunidade, não como uma pontuação medida.

O Piper ou o Kokoro suportam clonagem de voz?

Não. Ambos os mecanismos oferecem um conjunto fixo de vozes pré-treinadas entre as quais você escolhe — nenhum dos dois clona uma nova voz a partir de uma amostra de áudio de referência curta. Para clonagem de voz, veja a análise do XTTS v2 da PromptQuorum, observando sua licença não comercial.

Posso rodar o Kokoro sem GPU?

Sim. Com 82 milhões de parâmetros, o Kokoro roda em CPU, embora uma GPU modesta acelere a síntese. Ele não exige hardware GPU como frequentemente exigem modelos TTS ou de clonagem de voz maiores.

O Piper pode rodar em um Raspberry Pi?

Sim — a síntese em tempo real, somente em CPU, em um Raspberry Pi é um dos principais objetivos de design do Piper, e ele é o mecanismo de texto para voz local padrão no pipeline de voz do Home Assistant, que frequentemente roda em hardware Raspberry Pi.

Qual licença o Kokoro usa?

O Kokoro tem licença Apache-2.0, uma licença permissiva sem obrigações de copyleft, confirmada em seu model card no Hugging Face. Pode ser usado em produtos comerciais de código fechado sem a necessidade de publicar seu próprio código-fonte, sujeito aos termos padrão de atribuição e concessão de patente da licença.

Qual licença o Piper usa?

O repositório ativamente mantido do Piper (OHF-Voice/piper1-gpl) tem licença GPL-3.0-or-later. O repositório original, rhasspy/piper, hoje arquivado, era licenciado sob MIT. A GPL-3.0 só impõe condições se você distribuir uma versão modificada do próprio código-fonte do Piper; usá-lo como ferramenta externa geralmente não coloca sua própria aplicação sob a GPL.

Quem mantém o Piper e o Kokoro?

O Piper foi criado originalmente por Michael Hansen dentro do projeto de assistente de voz Rhasspy; o desenvolvimento ativo hoje é mantido pela Open Home Foundation, a organização sem fins lucrativos por trás do Home Assistant. O Kokoro foi lançado pelo desenvolvedor conhecido como hexgrad e é distribuído via Hugging Face.

Quantos idiomas o Piper e o Kokoro suportam?

As 54 vozes integradas do Kokoro, segundo seu model card no Hugging Face, abrangem 8 grupos de idiomas e sotaques, incluindo inglês americano e britânico, espanhol, francês, hindi, italiano, japonês, português brasileiro e chinês mandarim. O catálogo de vozes do Piper é maior e mais fragmentado — dezenas de idiomas e variantes regionais, contribuídas por diferentes membros da comunidade, com qualidade variável por voz.

Veredito

Piper e Kokoro não competem exatamente pela mesma tarefa. O Piper é a escolha certa quando a restrição é o hardware — um Raspberry Pi, um dispositivo embarcado, um assistente de voz que precisa responder instantaneamente apenas com CPU — e sua licença GPL-3.0-or-later é gratuita para uso comercial desde que você não redistribua código-fonte modificado do Piper. O Kokoro é a escolha certa quando a restrição é a qualidade de áudio: com 82 milhões de parâmetros, ele continua pequeno e amigável à CPU, mas as comparações de escuta da comunidade o descrevem consistentemente como mais natural do que o Piper, e sua licença Apache-2.0 não tem nenhuma restrição de copyleft. Nenhuma das duas ferramentas clona uma voz a partir de um clipe de amostra — se essa for a necessidade real, esta comparação não é a resposta; veja a análise do XTTS v2 da PromptQuorum, ou a comparação com o ElevenLabs para uma opção comercial gerenciada. Em caso de dúvida, comece com o Piper pela instalação mais simples e resultados mais rápidos, e mude para o Kokoro se a qualidade de saída não atender ao seu padrão.

Fontes

← Voltar para LLMs locais avançados