Principais conclusões
- Piper: sem clonagem de voz, vozes fixas por idioma, tempo real em CPU (compatível com Raspberry Pi), licença GPL-3.0-or-later.
- Chatterbox: clonagem de voz zero-shot a partir de ~7-20 segundos de áudio, base Llama de 0,5B parâmetros, licença MIT, GPU recomendada.
- O Chatterbox inclui um controle de exagero para intensidade emocional; o Piper não tem controles emocionais.
- A Resemble AI relata uma preferência em teste cego em relação ao ElevenLabs para o Chatterbox — uma alegação do próprio publicador do modelo, não uma conclusão do PromptQuorum.
- Ambos os projetos são softwares de código aberto gratuitos, sem taxa de licença.
- Escolha com base no hardware e na necessidade de clonagem, não em qual é "melhor" de forma abstrata — eles resolvem problemas diferentes.
📍 Em uma frase
O Piper é um motor de texto para voz neural leve, somente CPU, com vozes pré-treinadas fixas e sem clonagem, atualmente sob a licença GPL-3.0-or-later; o Chatterbox é um modelo de 0,5B parâmetros com base Llama, licenciado sob MIT, da Resemble AI, que clona uma voz a partir de um clipe de referência curto e roda melhor em GPU.
💬 Em termos simples
O Piper é a ferramenta que lê texto em voz alta rapidamente em quase qualquer computador, usando vozes que alguém já gravou e treinou. O Chatterbox é a ferramenta que consegue copiar a voz de uma pessoa específica a partir de uma gravação curta e depois falar novas frases com essa voz, mas precisa de uma placa de vídeo mais potente para fazer isso rapidamente.
📌Nota: A licença do Piper mudou de MIT para GPL-3.0-or-later em 2025, quando o desenvolvimento ativo passou para a Open Home Foundation. Se você avaliou o Piper antes disso presumindo a licença MIT, verifique novamente antes de embutir a ferramenta em um produto de código fechado — veja a seção Licença e custo de hardware abaixo.
O que cada ferramenta realmente faz
Piper e Chatterbox convertem texto em áudio falado, mas usam arquiteturas fundamentalmente diferentes e resolvem problemas diferentes. O Piper é otimizado para velocidade e baixo consumo de recursos com um catálogo fixo de vozes; o Chatterbox é otimizado para clonar uma voz específica sob demanda.
- Piper: síntese rápida, com voz fixa, focada em CPU. O Piper converte texto em fonemas usando o espeak-ng e depois sintetiza uma forma de onda a partir desses fonemas com um modelo no estilo VITS exportado para o ONNX Runtime, o que o torna rápido o suficiente para rodar em tempo real em um Raspberry Pi. Cada voz é um modelo treinado e baixável separadamente — não há mecanismo para gerar uma nova voz a partir de uma amostra.
- Chatterbox: clonagem de voz zero-shot em uma base Llama. O Chatterbox, lançado pela Resemble AI, usa uma arquitetura de 0,5 bilhão de parâmetros construída sobre uma base Llama. Com um clipe de áudio de referência curto — cerca de 7 a 20 segundos, segundo a própria metodologia de avaliação publicada pela Resemble AI — ele clona essa voz e gera nova fala nela, sem ajuste fino nem treinamento adicional.
- Controle de exagero (somente Chatterbox). O Chatterbox expõe um parâmetro
exaggeration(padrão 0,5) que ajusta a intensidade emocional da fala gerada; a própria documentação do projeto observa que aumentá-lo tende a acelerar a fala, e reduzir o valor decfg(orientação livre de classificador) pode compensar com um ritmo mais lento e deliberado. - Marca d'água neural (somente Chatterbox). Todo clipe de áudio gerado pelo Chatterbox inclui uma marca d'água Perth imperceptível, projetada pela Resemble AI para sobreviver à compressão MP3 e a edições de áudio comuns, com o objetivo de tornar a fala gerada por IA identificável posteriormente.
- O Piper não tem clonagem, controle emocional nem marca d'água — é uma ferramenta deliberadamente mais restrita por design, trocando esses recursos por velocidade somente em CPU e uma pegada de recursos muito menor.
Comparativo lado a lado
O Piper vence em velocidade e custo de hardware; o Chatterbox vence em clonagem de voz e expressividade. Nenhum é uma evolução estrita do outro — a tabela abaixo mapeia as diferenças concretas que devem guiar sua escolha.
Uso principal
- Piper:
- Voz em tempo real em hardware somente CPU/embarcado
- Chatterbox:
- Clonagem de voz zero-shot e narração expressiva
Clonagem de voz
- Piper:
- Não — apenas vozes pré-treinadas fixas
- Chatterbox:
- Sim — a partir de ~7-20 segundos de áudio de referência
Controle emocional
- Piper:
- Nenhum
- Chatterbox:
- Sim — parâmetro
exaggeration
Arquitetura
- Piper:
- Estilo VITS, ONNX Runtime, fonemas espeak-ng
- Chatterbox:
- Base Llama de 0,5B parâmetros
Hardware
- Piper:
- CPU (compatível com Raspberry Pi); CUDA opcional
- Chatterbox:
- GPU recomendada (
device="cuda") em tempo real
Licença atual
- Piper:
- GPL-3.0-or-later
- Chatterbox:
- MIT
Publicador/mantenedor
- Piper:
- Open Home Foundation
- Chatterbox:
- Resemble AI
Marca d'água
- Piper:
- Nenhuma
- Chatterbox:
- Sim — marca d'água neural Perth
Exemplos reais de uso
Estes comandos usam a CLI e a API Python documentadas de cada projeto.
- O Piper não precisa de nenhuma configuração de GPU —
pip install piper-ttsjá traz automaticamente sua dependência de CPU do ONNX Runtime. - O Chatterbox funciona em CPU (
device="cpu"), mas a geração em tempo real e o desempenho de baixa latência documentado pressupõem aceleração por GPU.
# ── Piper: instalar e sintetizar em CPU ────────────────────────────────
pip install piper-tts
python3 -m piper.download_voices en_US-lessac-medium
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."
# API Python do Piper
from piper import PiperVoice
voice = PiperVoice.load("en_US-lessac-medium.onnx")
with open("test.wav", "wb") as wav_file:
voice.synthesize_wav("Hello from Piper.", wav_file)
# ── Chatterbox: instalar e clonar uma voz ──────────────────────────────
pip install chatterbox-tts
import torchaudio as ta
from chatterbox.tts import ChatterboxTTS
device = "cuda" # GPU recomendada; "cpu" também funciona, bem mais lento
model = ChatterboxTTS.from_pretrained(device=device)
# Gerar com a voz padrão do modelo
wav = model.generate("This is a test.")
ta.save("output.wav", wav, model.sr)
# Clone zero-shot a partir de um clipe de referência curto, com configuração de exagero
AUDIO_PROMPT_PATH = "reference_voice.wav"
wav = model.generate(
"This is the cloned voice speaking a new sentence.",
audio_prompt_path=AUDIO_PROMPT_PATH,
exaggeration=0.6,
)
ta.save("output_cloned.wav", wav, model.sr)Licença e custo de hardware
O repositório atualmente mantido do Piper, OHF-Voice/piper1-gpl, é licenciado sob GPL-3.0-or-later. Isso é uma mudança em relação ao repositório original rhasspy/piper, que era licenciado sob MIT antes de ser arquivado (tornado somente leitura) em 6 de outubro de 2025. A GPL-3.0 é copyleft: usar o Piper como ferramenta externa (CLI, pacote Python ou servidor web chamado como processo separado) geralmente não coloca sua própria aplicação sob a GPL, mas distribuir uma versão modificada do código-fonte do próprio Piper exige publicar essas modificações sob a mesma licença. Isto não é aconselhamento jurídico — consulte um advogado antes de uma implantação comercial que modifique e redistribua o código-fonte do Piper.
O Chatterbox é licenciado sob MIT, confirmado pelo arquivo LICENSE no resemble-ai/chatterbox no GitHub — uma licença permissiva que permite uso comercial, modificação e redistribuição com condições mínimas (manter o aviso de copyright e o texto da licença).
O custo de hardware é o verdadeiro fator diferenciador, não taxas de licença — ambos os projetos são softwares gratuitos. O Piper roda em tempo real em hardware de CPU tão modesto quanto um Raspberry Pi, então seu custo efetivo fica próximo de zero além do dispositivo que você já possui. O desempenho de baixa latência documentado do Chatterbox pressupõe aceleração por GPU (device="cuda"); rodá-lo bem normalmente significa orçar uma GPU compatível com CUDA, seja uma placa NVIDIA de consumo ou uma instância de GPU em nuvem alugada, já que a inferência somente em CPU é notavelmente mais lenta.
Qual licença o Piper usa hoje, e ela mudou?
O repositório ativamente mantido OHF-Voice/piper1-gpl é licenciado sob GPL-3.0-or-later. O repositório original rhasspy/piper era licenciado sob MIT antes de ser arquivado em 6 de outubro de 2025. É uma diferença real para uso comercial — verifique a licença atual antes de embutir o Piper em um produto de código fechado.
Quem deve usar qual
Use o Piper se o seu projeto roda em hardware somente CPU ou embarcado e não precisa de clonagem de voz. Use o Chatterbox se precisar clonar uma voz específica a partir de um clipe de referência curto e puder rodá-lo em GPU. A decisão se resume a essas duas restrições, não a uma preferência geral de qualidade.
- Assistentes de voz e dispositivos embarcados → Piper. Desempenho em tempo real em um Raspberry Pi ou hardware de baixo consumo similar, sem dependência de GPU, é exatamente para o que o Piper foi construído — por isso é o motor TTS local padrão no pipeline de voz do Home Assistant.
- Ferramentas de acessibilidade e leitores de tela → Piper. Vozes fixas e confiáveis e baixa latência em hardware modesto importam mais aqui do que expressividade ou clonagem.
- Narração de audiolivros ou dublagem com uma voz específica → Chatterbox. A clonagem zero-shot a partir de um clipe de referência curto, combinada com o controle de exagero para ritmo e interpretação, se encaixa em trabalhos de narração que precisam de uma voz consistente e reconhecível.
- Produtos de voz personalizados ou de marca → Chatterbox. Se a proposta de valor do produto depende de uma voz clonada específica — um narrador, um mascote de marca, um assistente pessoal com uma persona escolhida —, o Piper não consegue fazer isso de forma alguma; o Chatterbox foi construído para isso.
- Frotas de servidores somente CPU com orçamento restrito e alto volume de chamadas → Piper. O baixo consumo de recursos do Piper escala de forma mais previsível em muitas instâncias simultâneas somente com CPU do que um modelo dependente de GPU.
- Na dúvida, comece com o Piper. Ele não tem dependência de GPU, se instala com um único comando
pip install piper-ttse cobre o caso comum de "ler este texto em voz alta" sem nenhuma exigência de clonagem. Migre para o Chatterbox especificamente quando um projeto exigir clonar uma voz específica.
Para que nenhuma das duas serve bem
Ambas as ferramentas têm limitações reais fora dos seus objetivos de design principais.
- O Piper não consegue clonar uma voz a partir de uma amostra, ponto final. Se qualquer parte do requisito envolve reproduzir a voz de uma pessoa específica a partir de áudio de referência, o Piper é a ferramenta errada independentemente das restrições de hardware — use o Chatterbox ou o XTTS v2 em vez disso.
- O Chatterbox em hardware somente CPU não é adequado para uso em tempo real. Ele roda em CPU (
device="cpu"), mas seu desempenho de baixa latência documentado pressupõe aceleração por GPU; trate o Chatterbox somente CPU como adequado para geração em lote offline, não para fala interativa em tempo real. - Nenhuma das ferramentas trata do consentimento para clonar a voz de uma pessoa real. Clonar ou sintetizar a voz de uma pessoa real e identificável sem seu conhecimento ou consentimento levanta questões de consentimento, direito de imagem e potencialmente fraude ou personificação que existem independentemente da licença de software de ambos os projetos — isso se aplica independentemente da ferramenta usada, e independentemente do contexto comercial ou pessoal.
- A GPL-3.0 no repositório atual do Piper é uma restrição real para redistribuição de código fechado. Se uma implantação envolve modificar e redistribuir o próprio código-fonte do Piper dentro de um produto de código fechado, os termos GPL-3.0-or-later do repositório atual se aplicam — isso não existia sob o repositório original licenciado sob MIT, então planos feitos antes de outubro de 2025 devem ser reverificados.
- A preferência relatada do Chatterbox em relação ao ElevenLabs é uma alegação do fornecedor, não um benchmark independente. A Resemble AI, empresa que publica o Chatterbox, relata uma preferência de avaliadores em teste cego pelo Chatterbox em relação ao ElevenLabs, com base em avaliações feitas pela plataforma terceirizada Podonos. O PromptQuorum não reproduziu essa avaliação de forma independente; trate-a como uma alegação do próprio publicador do modelo, não como um resultado de terceiros verificado, e pondere-a de acordo se a qualidade de voz em relação ao ElevenLabs for um fator decisivo para o seu projeto.
Alternativas
XTTS v2
- Melhor para:
- Clonagem de voz multilíngue em 17 idiomas a partir de ~6 segundos de áudio
- Licença:
- CPML (não comercial)
Ferramenta Coqui TTS
- Melhor para:
- Kit flexível multi-backend (VITS, Tacotron2, XTTS) com amplo suporte a idiomas
- Licença:
- MPL-2.0
StyleTTS 2
- Melhor para:
- Maior qualidade de narração em inglês com som natural (sem clonagem de voz)
- Licença:
- MIT
Bark
- Melhor para:
- Áudio expressivo não falado — risadas, suspiros, som ambiente
- Licença:
- MIT
ElevenLabs
- Melhor para:
- API em nuvem gerenciada para equipes que preferem não hospedar por conta própria, com clonagem de voz comercial
- Licença:
- Proprietária (API em nuvem paga)
Perguntas frequentes
Qual é a principal diferença entre Piper e Chatterbox TTS?
O Piper é um motor de texto para voz leve, somente CPU, com um conjunto fixo de vozes pré-treinadas e sem capacidade de clonagem. O Chatterbox é um modelo de 0,5 bilhão de parâmetros com base Llama da Resemble AI que clona uma voz específica a partir de um clipe de referência curto e funciona melhor com aceleração por GPU. Eles resolvem problemas diferentes em vez de competir no mesmo eixo.
O Piper consegue clonar uma voz como o Chatterbox faz?
Não. O Piper sintetiza fala apenas a partir de modelos de voz pré-treinados que você baixa e seleciona; ele não tem nenhum mecanismo para gerar uma nova voz a partir de uma amostra de áudio de referência. Para clonagem de voz, use o Chatterbox ou o XTTS v2.
Preciso de uma GPU para rodar o Chatterbox?
Não estritamente — o Chatterbox suporta device="cpu" — mas seu desempenho documentado de baixa latência e tempo real pressupõe aceleração por GPU via device="cuda". O Chatterbox somente CPU é viável para geração em lote offline, mas notavelmente mais lento do que em GPU.
O Piper exige GPU?
Não. O Piper é projetado para rodar em tempo real em hardware somente CPU, incluindo um Raspberry Pi. Aceleração GPU CUDA opcional está disponível via o pacote onnxruntime-gpu para maior throughput, mas não é obrigatória.
Qual licença o Chatterbox usa?
O Chatterbox é licenciado sob MIT, conforme o arquivo LICENSE no repositório GitHub resemble-ai/chatterbox — uma licença permissiva que permite uso comercial, modificação e redistribuição com condições mínimas.
Qual licença o Piper usa, e ela mudou?
O repositório ativamente mantido OHF-Voice/piper1-gpl é licenciado sob GPL-3.0-or-later. O repositório original rhasspy/piper era licenciado sob MIT antes de ser arquivado em 6 de outubro de 2025, quando o desenvolvimento ativo passou para a Open Home Foundation. Verifique a licença atual antes de embutir o Piper em um produto de código fechado.
É verdade que o Chatterbox vence o ElevenLabs em testes cegos?
A Resemble AI, empresa que publica o Chatterbox, relata que a maioria dos avaliadores em teste cego preferiu o Chatterbox em relação ao ElevenLabs em uma avaliação feita pela plataforma terceirizada Podonos. Esta é uma alegação publicada pelo próprio publicador do Chatterbox; o PromptQuorum não a reproduziu de forma independente, e os leitores devem tratá-la como uma alegação a ser verificada, não como um benchmark independente estabelecido.
Quanto áudio de referência o Chatterbox precisa para clonar uma voz?
Cerca de 7 a 20 segundos de áudio de referência, segundo a própria metodologia de avaliação publicada pela Resemble AI para o Chatterbox. Um clipe de referência mais limpo e com um único locutor geralmente produz um clone mais preciso.
Qual devo usar para um assistente de voz local?
O Piper, em quase todos os casos. Assistentes de voz normalmente rodam em hardware modesto somente com CPU e não exigem clonar a voz de uma pessoa específica — o desempenho em tempo real do Piper na CPU e a ausência de dependência de GPU se encaixam diretamente nesse caso de uso, por isso ele é o motor TTS local padrão no pipeline de voz do Home Assistant.
Posso usar Piper e Chatterbox juntos no mesmo projeto?
Sim — não há conflito técnico. Um padrão comum é usar o Piper para narração rápida e de propósito geral somente com CPU, e o Chatterbox especificamente para a parte do conteúdo que precisa de uma voz clonada ou emocionalmente expressiva, aceitando a exigência extra de GPU apenas onde ela é realmente necessária.
Veredito
Piper e Chatterbox não são realmente concorrentes — eles respondem perguntas diferentes. Se a pergunta é "como consigo síntese de voz local rápida, confiável e totalmente local em hardware sem GPU", o Piper é a resposta bem comprovada: tempo real em um Raspberry Pi, sem clonagem necessária nem oferecida, e um simples pip install piper-tts. Se a pergunta é "como faço uma voz específica dizer coisas novas a partir de um clipe de referência curto", o Chatterbox foi construído exatamente para isso, com licença MIT, uma base Llama de 0,5B parâmetros, e um controle de exagero para a entrega emocional — ao custo de precisar de uma GPU para fazer isso bem. A vantagem relatada do Chatterbox em relação ao ElevenLabs em avaliações cegas vale a pena conhecer, mas é uma alegação da própria Resemble AI, não um resultado verificado de forma independente, então pondere-a como evidência de marketing, não como um fato estabelecido. Para a maioria dos projetos de assistente de voz local e hardware embarcado, comece com o Piper; recorra ao Chatterbox somente quando clonar uma voz específica for uma exigência real, e combine este comparativo com a análise dedicada do Piper TTS ou a análise do XTTS v2 do PromptQuorum para um olhar mais profundo sobre qualquer um dos lados.
Fontes
- OHF-Voice/piper1-gpl no GitHub — o repositório ativamente mantido do Piper: README, documentação, licença, histórico de versões.
- rhasspy/piper no GitHub — o repositório original do Piper, hoje arquivado (licença MIT), arquivado em 6 de outubro de 2025.
- resemble-ai/chatterbox no GitHub — o repositório oficial do Chatterbox: README, licença, documentação de instalação e uso.
- Resemble AI: Chatterbox — a própria página da Resemble AI descrevendo a preferência relatada de avaliadores em teste cego em relação ao ElevenLabs via Podonos.
- Análise do Piper TTS — a análise dedicada do PromptQuorum sobre o Piper, incluindo o histórico da mudança de licença de 2025.
