Skip to main content
PromptQuorum
Início/LLMs locais avançados/Piper TTS: análise (2026) — síntese de voz neural local e rápida
Voice, Speech & Multimodal

Piper TTS: análise (2026) — síntese de voz neural local e rápida

·11 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

**O Piper é um mecanismo de síntese de voz neural local e gratuito, criado dentro do projeto de assistente de voz Rhasspy por Michael Hansen, hoje mantido pela Open Home Foundation em OHF-Voice/piper1-gpl, rápido o suficiente para rodar em tempo real em hardware somente com CPU, como um Raspberry Pi.** Instale com pip install piper-tts. Desde 2025, o repositório ativamente mantido está sob a licença GPL-3.0-or-later — uma mudança em relação à licença MIT do repositório original rhasspy/piper, agora arquivado. Para uma análise de licenças entre Piper, Coqui TTS, XTTS v2, F5-TTS, Bark e StyleTTS 2, veja o guia de licenças de TTS local da PromptQuorum.

O Piper é um mecanismo de síntese de voz neural local e gratuito que converte texto em áudio falado inteiramente no seu próprio dispositivo, criado originalmente dentro do projeto de assistente de voz de código aberto Rhasspy por Michael Hansen. Em 2025, o desenvolvimento ativo migrou para um novo repositório, OHF-Voice/piper1-gpl, mantido pela Open Home Foundation — a organização sem fins lucrativos por trás do Home Assistant — e o repositório original rhasspy/piper foi arquivado (tornado somente leitura) em 6 de outubro de 2025. Esta análise cobre essa história, comandos reais de instalação e uso, sua licença atual (que mudou de MIT para GPL-3.0-or-later) e onde o Piper não é a ferramenta certa — com um link para o guia de licenças da PromptQuorum e sua comparação com o ElevenLabs.

Piper TTS: análise (2026) — síntese de voz neural local e rápida

Principais conclusões

  • Criado dentro do projeto de assistente de voz Rhasspy por Michael Hansen.
  • Repositório original rhasspy/piper arquivado (somente leitura) em 6 de outubro de 2025, sob a licença MIT.
  • Desenvolvimento ativo hoje em OHF-Voice/piper1-gpl (criado em 28 de março de 2025), sob a Open Home Foundation, a organização sem fins lucrativos por trás do Home Assistant.
  • Licença atual: GPL-3.0-or-later — uma mudança em relação à licença MIT do repositório arquivado.
  • Gratuito, sem plano pago; inferência em tempo real na CPU, aceleração GPU CUDA opcional.
  • Última versão: v1.8.0, publicada em 4 de setembro de 2026.

📍 Em uma frase

O Piper é um mecanismo de síntese de voz neural local e gratuito, criado originalmente dentro do projeto de assistente de voz Rhasspy por Michael Hansen e hoje mantido pela Open Home Foundation, rápido o suficiente para rodar em tempo real em hardware somente com CPU, como um Raspberry Pi, cuja licença passou de MIT para GPL-3.0-or-later ao migrar para um novo repositório em 2025.

💬 Em termos simples

É um programa que você instala com pip install e que transforma texto digitado em áudio falado no seu próprio dispositivo — sem conta na nuvem, sem necessidade de conexão à internet, e roda rápido o suficiente para fala em tempo real mesmo em hardware bem modesto.

📌Nota: A licença mudou em 2025. Se você avaliou o Piper antes disso presumindo que ele fosse licenciado como MIT, verifique novamente antes de usar o repositório atualmente mantido em um produto de código fechado — veja a seção Licença e custo abaixo.

História: de Rhasspy à Open Home Foundation

O Piper nasceu dentro do Rhasspy, um conjunto de ferramentas de código aberto para construir assistentes de voz totalmente offline, onde Michael Hansen o desenvolveu como um mecanismo de síntese de voz local e rápido para combinar com o reconhecimento de voz local do Rhasspy — evitando uma ida e volta a uma API TTS na nuvem a cada resposta falada. O Piper usa uma arquitetura neural de texto para forma de onda do tipo VITS: o texto é primeiro convertido em fonemas (usando o espeak-ng), e então um modelo exportado para o ONNX Runtime sintetiza diretamente uma forma de onda a partir desses fonemas, com inferência rápida mesmo em hardware somente com CPU.

**O repositório original, rhasspy/piper, tornou-se um dos mecanismos TTS locais mais usados** no ecossistema de código aberto de automação residencial e acessibilidade, acumulando mais de 11.000 estrelas no GitHub sob sua licença MIT. Tornou-se o mecanismo de síntese de voz local padrão no pipeline de voz do Home Assistant.

Em 2025, o desenvolvimento ativo migrou para um novo repositório. O OHF-Voice/piper1-gpl foi criado em 28 de março de 2025, sob a Open Home Foundation — a organização sem fins lucrativos que também administra o Home Assistant. O repositório original rhasspy/piper foi posteriormente arquivado (tornado somente leitura) em 6 de outubro de 2025; ele permanece disponível sob sua licença MIT original, mas não recebe mais atualizações.

O novo repositório usa uma licença diferente: GPL-3.0-or-later, em vez da licença MIT original. O projeto não declara o motivo no README ou no changelog, mas o piper1-gpl incorpora o espeak-ng para fonemização, e o próprio espeak-ng é licenciado sob GPL-3.0 — uma explicação plausível para a mudança de licença, que a PromptQuorum, no entanto, não conseguiu confirmar como o motivo declarado oficialmente. No momento desta publicação, o próprio README do projeto afirma que a Open Home Foundation está buscando mais mantenedores para o Piper.

Quem criou o Piper?

O Piper foi criado por Michael Hansen dentro do projeto de assistente de voz de código aberto Rhasspy. O desenvolvimento migrou depois para um novo repositório, OHF-Voice/piper1-gpl, mantido pela Open Home Foundation.

O que o Piper realmente faz

O Piper converte texto escrito em áudio falado usando um pipeline de síntese de voz neural: o texto é convertido em fonemas via espeak-ng, e então um modelo de voz treinado sintetiza uma forma de onda a partir desses fonemas, rodando sobre o ONNX Runtime para velocidade.

  • Síntese via linha de comando. Execute python3 -m piper com um modelo de voz baixado para sintetizar um arquivo WAV ou transmitir áudio diretamente para os alto-falantes.
  • API Python. Carregue uma voz com PiperVoice.load() e chame .synthesize_wav() ou o gerador de streaming .synthesize() a partir da sua própria aplicação Python.
  • Modo servidor web HTTP. O Piper pode rodar como um servidor web persistente para que os modelos de voz permaneçam carregados na memória, evitando o custo de recarregamento da CLI a cada chamada — recomendado para uso repetido ou em produção.
  • API C/C++ (libpiper). Uma biblioteca C++ nativa e sua CLI, portada do repositório Piper legado, para incorporar o Piper em aplicações que não usam Python.
  • Injeção de fonemas brutos. Envolver o texto em `[[ ... ]] permite passar fonemas IPA diretamente (obtidos de espeak-ng --ipa=3`), útil para corrigir a pronúncia de nomes ou termos técnicos.
  • Aceleração GPU opcional. Passar --cuda (CLI) ou use_cuda=True (Python) ativa a aceleração CUDA via o pacote onnxruntime-gpu, embora o Piper seja projetado para rodar em velocidade aceitável apenas com CPU.
  • Vozes multilíngues treinadas pela comunidade. Dezenas de idiomas e variantes regionais estão disponíveis como modelos de voz baixados separadamente pelo Hugging Face; a qualidade varia por voz, já que são treinadas por diferentes colaboradores da comunidade.

Instalar e executar o Piper: passo a passo

Este guia instala o Piper via pip e executa uma primeira síntese, seguindo a sintaxe documentada na própria CLI e na API Python do projeto.

  1. 1
    Instalar o Piper.
    Why it matters: Execute `pip install piper-tts` em um ambiente Python (recomenda-se Python 3.9+). Isso instala o pacote `piper` e sua dependência do ONNX Runtime; nenhuma configuração de GPU ou CUDA é necessária para uso somente com CPU.
  2. 2
    Listar e baixar uma voz.
    Why it matters: Execute `python3 -m piper.download_voices` sem argumentos para listar as vozes disponíveis, depois `python3 -m piper.download_voices en_US-lessac-medium` para baixar uma voz específica para o diretório atual.
  3. 3
    Sintetizar fala pela linha de comando.
    Why it matters: Execute `python3 -m piper -m en_US-lessac-medium -f test.wav -- 'This is a test.'` para escrever um arquivo WAV. Com o `ffplay` instalado, omita o `-f` para ouvir o áudio imediatamente em vez de salvá-lo.
  4. 4
    (Opcional) Usar a API Python em vez da CLI.
    Why it matters: Para uso repetido dentro de uma aplicação, `from piper import PiperVoice; voice = PiperVoice.load("en_US-lessac-medium.onnx")` seguido de `voice.synthesize_wav(text, wav_file)` evita o custo de inicialização da CLI a cada chamada.
  5. 5
    (Opcional) Ativar a aceleração GPU.
    Why it matters: Instale o pacote `onnxruntime-gpu`, depois passe `--cuda` na CLI ou `use_cuda=True` para `PiperVoice.load()` no Python. É opcional — o Piper é projetado para rodar em tempo real apenas com CPU.
  6. 6
    (Opcional) Executar o servidor web para uso repetido.
    Why it matters: Para uma configuração de produção ou de uso repetido, execute o modo servidor web HTTP do Piper para que o modelo de voz permaneça carregado na memória em vez de ser recarregado a cada chamada da CLI.
  7. 7
    (Opcional) Corrigir uma palavra mal pronunciada com fonemas brutos.
    Why it matters: Obtenha os fonemas IPA de uma palavra com `espeak-ng -v en-us --ipa=3 -q <palavra>`, depois envolva-os em `[[ ... ]]` dentro do texto de entrada para substituir a pronúncia automática do Piper para essa palavra.

Exemplos de uso reais

Além do guia básico de instalação acima, estes são padrões de uso reais comuns retirados da própria documentação do projeto.

  • Injeção de fonemas brutos para corrigir pronúncia: envolva texto como `The [[ bˈætmæn ]] not [[ bɹˈuːs wˈeɪn ]] usando fonemas IPA obtidos com espeak-ng -v en-us --ipa=3 -q <palavra>`.
  • API C/C++ libpiper expõe piper_create() (ou piper_create_with_options() para controle mais fino) para incorporar o Piper diretamente em uma aplicação nativa sem um runtime Python.
python
# Linha de comando: escrever um arquivo WAV
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."

# Linha de comando: reproduzir áudio imediatamente (requer ffplay)
python3 -m piper -m en_US-lessac-medium -- "This will play on your speakers."

# API Python
import wave
from piper import PiperVoice

voice = PiperVoice.load("en_US-lessac-medium.onnx")
with wave.open("test.wav", "wb") as wav_file:
    voice.synthesize_wav("Welcome to the world of speech synthesis!", wav_file)

# API Python: ajustar a síntese (velocidade, volume, expressividade)
from piper import SynthesisConfig

syn_config = SynthesisConfig(
    volume=0.5,        # metade do volume
    length_scale=2.0,  # duas vezes mais lento
    noise_scale=1.0,   # mais variação de áudio
    noise_w_scale=1.0, # mais variação na fala
)
voice.synthesize_wav("Custom synthesis settings.", wav_file, syn_config=syn_config)

# API Python: aceleração GPU (requer onnxruntime-gpu)
voice = PiperVoice.load("en_US-lessac-medium.onnx", use_cuda=True)

# API Python: síntese em streaming
for chunk in voice.synthesize("Streamed audio, chunk by chunk."):
    play_audio(chunk.audio_int16_bytes, chunk.sample_rate)

Licença e custo

**O repositório Piper ativamente mantido, OHF-Voice/piper1-gpl, é licenciado sob GPL-3.0-or-later**, confirmado pelos metadados publicados do pacote piper-tts no PyPI. Essa é uma mudança em relação ao repositório original rhasspy/piper, que era licenciado sob MIT antes de ser arquivado em 6 de outubro de 2025 e permanece disponível sob essa licença MIT, sem manutenção.

A GPL-3.0 é uma licença copyleft, o que é uma diferença real em relação à MIT para uso comercial. Você pode usar o Piper gratuitamente, inclusive comercialmente, para gerar fala. Mas a GPL-3.0 exige que, se você distribuir uma versão modificada do próprio código-fonte do Piper — por exemplo, um fork incorporado ou vinculado estaticamente ao seu produto — você deve liberar esse código modificado sob os mesmos termos da GPL-3.0. Usar o Piper sem modificações como uma ferramenta externa (chamando sua CLI, seu pacote Python ou seu servidor web como um processo separado) geralmente não coloca o restante do código da sua aplicação sob a GPL, mas o limite exato depende de quão estreitamente seu código está vinculado ao do Piper. Este parágrafo explica a forma geral da licença; não é aconselhamento jurídico — consulte um advogado para sua implantação específica antes de lançar um produto comercial construído sobre o Piper.

Não há plano pago, assinatura ou taxa de licença para o Piper em si. Os únicos custos são o hardware em que ele roda e o seu próprio tempo de desenvolvimento. Os modelos de voz são baixados separadamente de um repositório compartilhado no Hugging Face; verifique a licença indicada para cada voz individual antes de redistribuí-la, já que as vozes são contribuídas por diferentes membros da comunidade e não têm garantia de compartilhar a mesma licença do código do Piper.

Qual licença o Piper usa?

O repositório Piper ativamente mantido (OHF-Voice/piper1-gpl) é licenciado sob GPL-3.0-or-later. O repositório original, agora arquivado, rhasspy/piper era licenciado sob MIT. Essa é uma diferença real para uso comercial — a GPL-3.0 exige liberar sob a mesma licença as modificações do próprio código-fonte do Piper caso sejam distribuídas, algo que a MIT não exigia.

Para que o Piper não serve

O Piper é um mecanismo de síntese de voz local rápido e de propósito geral, não uma ferramenta de clonagem de voz ou fala expressiva. É a ferramenta errada nas seguintes situações:

  • Clonagem de voz expressiva, emocional ou a partir de poucos segundos. O Piper sintetiza fala a partir de modelos de voz pré-treinados, não a partir de um trecho curto de áudio de referência de uma pessoa específica. Se você precisa clonar uma voz a partir de poucos segundos de áudio de amostra, ou quer uma entonação mais expressiva, o XTTS v2 foi feito para isso — veja o guia de licenças de TTS local da PromptQuorum para seus termos de licença (não comercial).
  • Clonagem multi-falante a partir de uma amostra curta. Da mesma forma, o Piper não tem nenhum mecanismo integrado para gerar na hora uma nova voz a partir de uma amostra de áudio de um falante específico; cada voz é um modelo treinado e distribuído separadamente.
  • Obrigações copyleft da GPL-3.0 em um produto de código fechado. Se o seu caso de uso envolve modificar e redistribuir o próprio código-fonte do Piper dentro de um binário de código fechado, a licença GPL-3.0-or-later do repositório atual é uma restrição real que o repositório original, licenciado sob MIT, não tinha. Revise a seção Licença e custo acima e consulte um advogado antes desse tipo de implantação.
  • Qualidade de voz garantida e consistente em todos os idiomas. Como as vozes são treinadas e contribuídas por diferentes membros da comunidade, a qualidade varia perceptivelmente por idioma e por voz específica — verifique amostras do seu idioma alvo antes de se comprometer com o Piper para uma aplicação de produção.
  • Certeza de manutenção de longo prazo. No momento desta publicação, o próprio README do projeto afirma que a Open Home Foundation está buscando mais mantenedores para o Piper, algo a considerar antes de construir infraestrutura crítica sobre ele.

Alternativas ao Piper

Coqui TTS

Melhor para:
Kit de ferramentas flexível multi-backend (VITS, Tacotron2, XTTS) com amplo suporte a idiomas
Licença:
MPL-2.0

XTTS v2

Melhor para:
Clonagem de voz a partir de poucos segundos de áudio de referência, em 17 idiomas
Licença:
CPML (não comercial)

StyleTTS 2

Melhor para:
Maior qualidade de narração natural em inglês (sem clonagem de voz)
Licença:
MIT

Bark

Melhor para:
Áudio expressivo não verbal — risadas, suspiros, sons ambientes
Licença:
MIT

ElevenLabs

Melhor para:
API na nuvem gerenciada para equipes que preferem não se autoalojar, com clonagem de voz comercial
Licença:
Proprietária (API na nuvem paga)

Perguntas frequentes

O que é o Piper?

O Piper é um mecanismo de síntese de voz neural local e gratuito, criado dentro do projeto de assistente de voz Rhasspy por Michael Hansen, hoje mantido pela Open Home Foundation, que converte texto em áudio falado rápido o suficiente para rodar em tempo real em hardware somente com CPU.

O Piper é gratuito?

Sim. O Piper não tem plano pago, assinatura ou taxa de licença. Ele é licenciado atualmente sob GPL-3.0-or-later, que é gratuita para uso mas impõe condições à distribuição de versões modificadas do próprio código-fonte do Piper — veja a seção Licença e custo para detalhes.

Preciso de uma GPU para rodar o Piper?

Não. O Piper é projetado para rodar em tempo real em hardware somente com CPU, incluindo um Raspberry Pi. Aceleração GPU CUDA opcional está disponível via o pacote onnxruntime-gpu para maior throughput.

Qual é a diferença entre rhasspy/piper e OHF-Voice/piper1-gpl?

rhasspy/piper é o repositório original, criado dentro do projeto Rhasspy e licenciado sob MIT; foi arquivado (somente leitura) em 6 de outubro de 2025. OHF-Voice/piper1-gpl é o repositório sucessor ativamente mantido, criado em 28 de março de 2025 sob a Open Home Foundation, e licenciado sob GPL-3.0-or-later em vez de MIT.

O Piper pode clonar a voz de uma pessoa específica?

Não a partir de uma amostra curta de áudio. O Piper sintetiza fala usando modelos de voz pré-treinados que você baixa e seleciona; ele não clona uma nova voz na hora a partir de poucos segundos de áudio de referência. Para isso, veja o XTTS v2, projetado especificamente para clonagem de voz em poucos segundos.

O Piper é usado no Home Assistant?

Sim. O Piper é o mecanismo de síntese de voz local padrão no pipeline de assistente de voz do Home Assistant, mantido pela Open Home Foundation, a mesma organização sem fins lucrativos que administra o Home Assistant.

Quem mantém o Piper hoje?

O Piper é mantido sob a Open Home Foundation no repositório OHF-Voice/piper1-gpl, depois que o desenvolvimento migrou para lá a partir do repositório original hospedado no Rhasspy em 2025. O README do projeto afirma que a Open Home Foundation está atualmente buscando mais mantenedores.

Qual é a versão mais recente do Piper?

A versão estável mais recente é a v1.8.0, publicada em 4 de setembro de 2026, segundo a página de releases do projeto no GitHub.

Veredito

O Piper continua sendo uma das formas mais rápidas de obter síntese de voz local de verdade em hardware modesto — seu desempenho em tempo real somente com CPU foi o que o tornou a voz padrão do Home Assistant, e isso não mudou sob seus novos mantenedores. O que mudou, e o que todo leitor que avaliar o Piper em 2026 precisa saber, é a licença: o repositório ativamente mantido passou de MIT para GPL-3.0-or-later quando o desenvolvimento migrou para a Open Home Foundation em 2025, uma diferença real para quem planeja incorporar e redistribuir código-fonte modificado do Piper em um produto de código fechado. Ele continua gratuito, bem documentado e com lançamentos ativos (v1.8.0 até setembro de 2026), embora seus próprios mantenedores estejam abertamente buscando mais ajuda. Para síntese de voz rápida, offline e de propósito geral em hardware de classe CPU, o Piper é uma escolha bem verificada e sem custo — para clonagem de voz expressiva em poucos segundos, combine esta análise com a cobertura da PromptQuorum sobre o XTTS v2 ou compare com a alternativa gerenciada na nuvem na comparação ElevenLabs vs TTS local.

Fontes

← Voltar para LLMs locais avançados