Skip to main content
PromptQuorum
Início/LLMs locais avançados/Piper vs Chatterbox TTS (2026): voz local rápida ou clonagem de voz?
Voice, Speech & Multimodal

Piper vs Chatterbox TTS (2026): voz local rápida ou clonagem de voz?

·12 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

Use o Piper se você precisa de texto para voz local rápido em hardware somente com CPU e um conjunto fixo de vozes pré-treinadas; use o Chatterbox se precisa clonar uma voz específica a partir de um clipe de referência curto e tem uma GPU disponível. O Piper (pip install piper-tts) roda em tempo real em um Raspberry Pi e atualmente está sob a licença GPL-3.0-or-later da Open Home Foundation. O Chatterbox (pip install chatterbox-tts) é um modelo de 0,5B parâmetros com base Llama da Resemble AI, licenciado sob MIT, que clona uma voz a partir de cerca de 7 a 20 segundos de áudio de referência e adiciona um controle de exagero para intensidade emocional, com aceleração por GPU recomendada para uso em tempo real.

Piper e Chatterbox são dois motores de texto para voz gratuitos e de código aberto, mas resolvem problemas diferentes. O Piper, hoje mantido pela Open Home Foundation no OHF-Voice/piper1-gpl, é um motor TTS neural leve, feito para rodar em tempo real em hardware somente com CPU, incluindo um Raspberry Pi, usando um conjunto fixo de vozes pré-treinadas. O Chatterbox, lançado pela Resemble AI, é um modelo de 0,5 bilhão de parâmetros com base Llama, construído para clonagem de voz zero-shot a partir de um clipe de referência curto, com um controle de exagero para intensidade emocional, idealmente executado em GPU. Este comparativo cobre comandos reais de instalação, as licenças atuais, os requisitos de hardware e qual usar em cada projeto.

Piper vs Chatterbox TTS (2026): voz local rápida ou clonagem de voz?

Principais conclusões

  • Piper: sem clonagem de voz, vozes fixas por idioma, tempo real em CPU (compatível com Raspberry Pi), licença GPL-3.0-or-later.
  • Chatterbox: clonagem de voz zero-shot a partir de ~7-20 segundos de áudio, base Llama de 0,5B parâmetros, licença MIT, GPU recomendada.
  • O Chatterbox inclui um controle de exagero para intensidade emocional; o Piper não tem controles emocionais.
  • A Resemble AI relata uma preferência em teste cego em relação ao ElevenLabs para o Chatterbox — uma alegação do próprio publicador do modelo, não uma conclusão do PromptQuorum.
  • Ambos os projetos são softwares de código aberto gratuitos, sem taxa de licença.
  • Escolha com base no hardware e na necessidade de clonagem, não em qual é "melhor" de forma abstrata — eles resolvem problemas diferentes.

📍 Em uma frase

O Piper é um motor de texto para voz neural leve, somente CPU, com vozes pré-treinadas fixas e sem clonagem, atualmente sob a licença GPL-3.0-or-later; o Chatterbox é um modelo de 0,5B parâmetros com base Llama, licenciado sob MIT, da Resemble AI, que clona uma voz a partir de um clipe de referência curto e roda melhor em GPU.

💬 Em termos simples

O Piper é a ferramenta que lê texto em voz alta rapidamente em quase qualquer computador, usando vozes que alguém já gravou e treinou. O Chatterbox é a ferramenta que consegue copiar a voz de uma pessoa específica a partir de uma gravação curta e depois falar novas frases com essa voz, mas precisa de uma placa de vídeo mais potente para fazer isso rapidamente.

📌Nota: A licença do Piper mudou de MIT para GPL-3.0-or-later em 2025, quando o desenvolvimento ativo passou para a Open Home Foundation. Se você avaliou o Piper antes disso presumindo a licença MIT, verifique novamente antes de embutir a ferramenta em um produto de código fechado — veja a seção Licença e custo de hardware abaixo.

O que cada ferramenta realmente faz

Piper e Chatterbox convertem texto em áudio falado, mas usam arquiteturas fundamentalmente diferentes e resolvem problemas diferentes. O Piper é otimizado para velocidade e baixo consumo de recursos com um catálogo fixo de vozes; o Chatterbox é otimizado para clonar uma voz específica sob demanda.

  • Piper: síntese rápida, com voz fixa, focada em CPU. O Piper converte texto em fonemas usando o espeak-ng e depois sintetiza uma forma de onda a partir desses fonemas com um modelo no estilo VITS exportado para o ONNX Runtime, o que o torna rápido o suficiente para rodar em tempo real em um Raspberry Pi. Cada voz é um modelo treinado e baixável separadamente — não há mecanismo para gerar uma nova voz a partir de uma amostra.
  • Chatterbox: clonagem de voz zero-shot em uma base Llama. O Chatterbox, lançado pela Resemble AI, usa uma arquitetura de 0,5 bilhão de parâmetros construída sobre uma base Llama. Com um clipe de áudio de referência curto — cerca de 7 a 20 segundos, segundo a própria metodologia de avaliação publicada pela Resemble AI — ele clona essa voz e gera nova fala nela, sem ajuste fino nem treinamento adicional.
  • Controle de exagero (somente Chatterbox). O Chatterbox expõe um parâmetro exaggeration (padrão 0,5) que ajusta a intensidade emocional da fala gerada; a própria documentação do projeto observa que aumentá-lo tende a acelerar a fala, e reduzir o valor de cfg (orientação livre de classificador) pode compensar com um ritmo mais lento e deliberado.
  • Marca d'água neural (somente Chatterbox). Todo clipe de áudio gerado pelo Chatterbox inclui uma marca d'água Perth imperceptível, projetada pela Resemble AI para sobreviver à compressão MP3 e a edições de áudio comuns, com o objetivo de tornar a fala gerada por IA identificável posteriormente.
  • O Piper não tem clonagem, controle emocional nem marca d'água — é uma ferramenta deliberadamente mais restrita por design, trocando esses recursos por velocidade somente em CPU e uma pegada de recursos muito menor.

Comparativo lado a lado

O Piper vence em velocidade e custo de hardware; o Chatterbox vence em clonagem de voz e expressividade. Nenhum é uma evolução estrita do outro — a tabela abaixo mapeia as diferenças concretas que devem guiar sua escolha.

Uso principal

Piper:
Voz em tempo real em hardware somente CPU/embarcado
Chatterbox:
Clonagem de voz zero-shot e narração expressiva

Clonagem de voz

Piper:
Não — apenas vozes pré-treinadas fixas
Chatterbox:
Sim — a partir de ~7-20 segundos de áudio de referência

Controle emocional

Piper:
Nenhum
Chatterbox:
Sim — parâmetro exaggeration

Arquitetura

Piper:
Estilo VITS, ONNX Runtime, fonemas espeak-ng
Chatterbox:
Base Llama de 0,5B parâmetros

Hardware

Piper:
CPU (compatível com Raspberry Pi); CUDA opcional
Chatterbox:
GPU recomendada (device="cuda") em tempo real

Licença atual

Piper:
GPL-3.0-or-later
Chatterbox:
MIT

Publicador/mantenedor

Piper:
Open Home Foundation
Chatterbox:
Resemble AI

Marca d'água

Piper:
Nenhuma
Chatterbox:
Sim — marca d'água neural Perth

Exemplos reais de uso

Estes comandos usam a CLI e a API Python documentadas de cada projeto.

  • O Piper não precisa de nenhuma configuração de GPUpip install piper-tts já traz automaticamente sua dependência de CPU do ONNX Runtime.
  • O Chatterbox funciona em CPU (device="cpu"), mas a geração em tempo real e o desempenho de baixa latência documentado pressupõem aceleração por GPU.
python
# ── Piper: instalar e sintetizar em CPU ────────────────────────────────
pip install piper-tts
python3 -m piper.download_voices en_US-lessac-medium
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."

# API Python do Piper
from piper import PiperVoice
voice = PiperVoice.load("en_US-lessac-medium.onnx")
with open("test.wav", "wb") as wav_file:
    voice.synthesize_wav("Hello from Piper.", wav_file)

# ── Chatterbox: instalar e clonar uma voz ──────────────────────────────
pip install chatterbox-tts

import torchaudio as ta
from chatterbox.tts import ChatterboxTTS

device = "cuda"  # GPU recomendada; "cpu" também funciona, bem mais lento
model = ChatterboxTTS.from_pretrained(device=device)

# Gerar com a voz padrão do modelo
wav = model.generate("This is a test.")
ta.save("output.wav", wav, model.sr)

# Clone zero-shot a partir de um clipe de referência curto, com configuração de exagero
AUDIO_PROMPT_PATH = "reference_voice.wav"
wav = model.generate(
    "This is the cloned voice speaking a new sentence.",
    audio_prompt_path=AUDIO_PROMPT_PATH,
    exaggeration=0.6,
)
ta.save("output_cloned.wav", wav, model.sr)

Licença e custo de hardware

O repositório atualmente mantido do Piper, OHF-Voice/piper1-gpl, é licenciado sob GPL-3.0-or-later. Isso é uma mudança em relação ao repositório original rhasspy/piper, que era licenciado sob MIT antes de ser arquivado (tornado somente leitura) em 6 de outubro de 2025. A GPL-3.0 é copyleft: usar o Piper como ferramenta externa (CLI, pacote Python ou servidor web chamado como processo separado) geralmente não coloca sua própria aplicação sob a GPL, mas distribuir uma versão modificada do código-fonte do próprio Piper exige publicar essas modificações sob a mesma licença. Isto não é aconselhamento jurídico — consulte um advogado antes de uma implantação comercial que modifique e redistribua o código-fonte do Piper.

O Chatterbox é licenciado sob MIT, confirmado pelo arquivo LICENSE no resemble-ai/chatterbox no GitHub — uma licença permissiva que permite uso comercial, modificação e redistribuição com condições mínimas (manter o aviso de copyright e o texto da licença).

O custo de hardware é o verdadeiro fator diferenciador, não taxas de licença — ambos os projetos são softwares gratuitos. O Piper roda em tempo real em hardware de CPU tão modesto quanto um Raspberry Pi, então seu custo efetivo fica próximo de zero além do dispositivo que você já possui. O desempenho de baixa latência documentado do Chatterbox pressupõe aceleração por GPU (device="cuda"); rodá-lo bem normalmente significa orçar uma GPU compatível com CUDA, seja uma placa NVIDIA de consumo ou uma instância de GPU em nuvem alugada, já que a inferência somente em CPU é notavelmente mais lenta.

Qual licença o Piper usa hoje, e ela mudou?

O repositório ativamente mantido OHF-Voice/piper1-gpl é licenciado sob GPL-3.0-or-later. O repositório original rhasspy/piper era licenciado sob MIT antes de ser arquivado em 6 de outubro de 2025. É uma diferença real para uso comercial — verifique a licença atual antes de embutir o Piper em um produto de código fechado.

Quem deve usar qual

Use o Piper se o seu projeto roda em hardware somente CPU ou embarcado e não precisa de clonagem de voz. Use o Chatterbox se precisar clonar uma voz específica a partir de um clipe de referência curto e puder rodá-lo em GPU. A decisão se resume a essas duas restrições, não a uma preferência geral de qualidade.

  • Assistentes de voz e dispositivos embarcados → Piper. Desempenho em tempo real em um Raspberry Pi ou hardware de baixo consumo similar, sem dependência de GPU, é exatamente para o que o Piper foi construído — por isso é o motor TTS local padrão no pipeline de voz do Home Assistant.
  • Ferramentas de acessibilidade e leitores de tela → Piper. Vozes fixas e confiáveis e baixa latência em hardware modesto importam mais aqui do que expressividade ou clonagem.
  • Narração de audiolivros ou dublagem com uma voz específica → Chatterbox. A clonagem zero-shot a partir de um clipe de referência curto, combinada com o controle de exagero para ritmo e interpretação, se encaixa em trabalhos de narração que precisam de uma voz consistente e reconhecível.
  • Produtos de voz personalizados ou de marca → Chatterbox. Se a proposta de valor do produto depende de uma voz clonada específica — um narrador, um mascote de marca, um assistente pessoal com uma persona escolhida —, o Piper não consegue fazer isso de forma alguma; o Chatterbox foi construído para isso.
  • Frotas de servidores somente CPU com orçamento restrito e alto volume de chamadas → Piper. O baixo consumo de recursos do Piper escala de forma mais previsível em muitas instâncias simultâneas somente com CPU do que um modelo dependente de GPU.
  • Na dúvida, comece com o Piper. Ele não tem dependência de GPU, se instala com um único comando pip install piper-tts e cobre o caso comum de "ler este texto em voz alta" sem nenhuma exigência de clonagem. Migre para o Chatterbox especificamente quando um projeto exigir clonar uma voz específica.

Para que nenhuma das duas serve bem

Ambas as ferramentas têm limitações reais fora dos seus objetivos de design principais.

  • O Piper não consegue clonar uma voz a partir de uma amostra, ponto final. Se qualquer parte do requisito envolve reproduzir a voz de uma pessoa específica a partir de áudio de referência, o Piper é a ferramenta errada independentemente das restrições de hardware — use o Chatterbox ou o XTTS v2 em vez disso.
  • O Chatterbox em hardware somente CPU não é adequado para uso em tempo real. Ele roda em CPU (device="cpu"), mas seu desempenho de baixa latência documentado pressupõe aceleração por GPU; trate o Chatterbox somente CPU como adequado para geração em lote offline, não para fala interativa em tempo real.
  • Nenhuma das ferramentas trata do consentimento para clonar a voz de uma pessoa real. Clonar ou sintetizar a voz de uma pessoa real e identificável sem seu conhecimento ou consentimento levanta questões de consentimento, direito de imagem e potencialmente fraude ou personificação que existem independentemente da licença de software de ambos os projetos — isso se aplica independentemente da ferramenta usada, e independentemente do contexto comercial ou pessoal.
  • A GPL-3.0 no repositório atual do Piper é uma restrição real para redistribuição de código fechado. Se uma implantação envolve modificar e redistribuir o próprio código-fonte do Piper dentro de um produto de código fechado, os termos GPL-3.0-or-later do repositório atual se aplicam — isso não existia sob o repositório original licenciado sob MIT, então planos feitos antes de outubro de 2025 devem ser reverificados.
  • A preferência relatada do Chatterbox em relação ao ElevenLabs é uma alegação do fornecedor, não um benchmark independente. A Resemble AI, empresa que publica o Chatterbox, relata uma preferência de avaliadores em teste cego pelo Chatterbox em relação ao ElevenLabs, com base em avaliações feitas pela plataforma terceirizada Podonos. O PromptQuorum não reproduziu essa avaliação de forma independente; trate-a como uma alegação do próprio publicador do modelo, não como um resultado de terceiros verificado, e pondere-a de acordo se a qualidade de voz em relação ao ElevenLabs for um fator decisivo para o seu projeto.

Alternativas

XTTS v2

Melhor para:
Clonagem de voz multilíngue em 17 idiomas a partir de ~6 segundos de áudio
Licença:
CPML (não comercial)

Ferramenta Coqui TTS

Melhor para:
Kit flexível multi-backend (VITS, Tacotron2, XTTS) com amplo suporte a idiomas
Licença:
MPL-2.0

StyleTTS 2

Melhor para:
Maior qualidade de narração em inglês com som natural (sem clonagem de voz)
Licença:
MIT

Bark

Melhor para:
Áudio expressivo não falado — risadas, suspiros, som ambiente
Licença:
MIT

ElevenLabs

Melhor para:
API em nuvem gerenciada para equipes que preferem não hospedar por conta própria, com clonagem de voz comercial
Licença:
Proprietária (API em nuvem paga)

Perguntas frequentes

Qual é a principal diferença entre Piper e Chatterbox TTS?

O Piper é um motor de texto para voz leve, somente CPU, com um conjunto fixo de vozes pré-treinadas e sem capacidade de clonagem. O Chatterbox é um modelo de 0,5 bilhão de parâmetros com base Llama da Resemble AI que clona uma voz específica a partir de um clipe de referência curto e funciona melhor com aceleração por GPU. Eles resolvem problemas diferentes em vez de competir no mesmo eixo.

O Piper consegue clonar uma voz como o Chatterbox faz?

Não. O Piper sintetiza fala apenas a partir de modelos de voz pré-treinados que você baixa e seleciona; ele não tem nenhum mecanismo para gerar uma nova voz a partir de uma amostra de áudio de referência. Para clonagem de voz, use o Chatterbox ou o XTTS v2.

Preciso de uma GPU para rodar o Chatterbox?

Não estritamente — o Chatterbox suporta device="cpu" — mas seu desempenho documentado de baixa latência e tempo real pressupõe aceleração por GPU via device="cuda". O Chatterbox somente CPU é viável para geração em lote offline, mas notavelmente mais lento do que em GPU.

O Piper exige GPU?

Não. O Piper é projetado para rodar em tempo real em hardware somente CPU, incluindo um Raspberry Pi. Aceleração GPU CUDA opcional está disponível via o pacote onnxruntime-gpu para maior throughput, mas não é obrigatória.

Qual licença o Chatterbox usa?

O Chatterbox é licenciado sob MIT, conforme o arquivo LICENSE no repositório GitHub resemble-ai/chatterbox — uma licença permissiva que permite uso comercial, modificação e redistribuição com condições mínimas.

Qual licença o Piper usa, e ela mudou?

O repositório ativamente mantido OHF-Voice/piper1-gpl é licenciado sob GPL-3.0-or-later. O repositório original rhasspy/piper era licenciado sob MIT antes de ser arquivado em 6 de outubro de 2025, quando o desenvolvimento ativo passou para a Open Home Foundation. Verifique a licença atual antes de embutir o Piper em um produto de código fechado.

É verdade que o Chatterbox vence o ElevenLabs em testes cegos?

A Resemble AI, empresa que publica o Chatterbox, relata que a maioria dos avaliadores em teste cego preferiu o Chatterbox em relação ao ElevenLabs em uma avaliação feita pela plataforma terceirizada Podonos. Esta é uma alegação publicada pelo próprio publicador do Chatterbox; o PromptQuorum não a reproduziu de forma independente, e os leitores devem tratá-la como uma alegação a ser verificada, não como um benchmark independente estabelecido.

Quanto áudio de referência o Chatterbox precisa para clonar uma voz?

Cerca de 7 a 20 segundos de áudio de referência, segundo a própria metodologia de avaliação publicada pela Resemble AI para o Chatterbox. Um clipe de referência mais limpo e com um único locutor geralmente produz um clone mais preciso.

Qual devo usar para um assistente de voz local?

O Piper, em quase todos os casos. Assistentes de voz normalmente rodam em hardware modesto somente com CPU e não exigem clonar a voz de uma pessoa específica — o desempenho em tempo real do Piper na CPU e a ausência de dependência de GPU se encaixam diretamente nesse caso de uso, por isso ele é o motor TTS local padrão no pipeline de voz do Home Assistant.

Posso usar Piper e Chatterbox juntos no mesmo projeto?

Sim — não há conflito técnico. Um padrão comum é usar o Piper para narração rápida e de propósito geral somente com CPU, e o Chatterbox especificamente para a parte do conteúdo que precisa de uma voz clonada ou emocionalmente expressiva, aceitando a exigência extra de GPU apenas onde ela é realmente necessária.

Veredito

Piper e Chatterbox não são realmente concorrentes — eles respondem perguntas diferentes. Se a pergunta é "como consigo síntese de voz local rápida, confiável e totalmente local em hardware sem GPU", o Piper é a resposta bem comprovada: tempo real em um Raspberry Pi, sem clonagem necessária nem oferecida, e um simples pip install piper-tts. Se a pergunta é "como faço uma voz específica dizer coisas novas a partir de um clipe de referência curto", o Chatterbox foi construído exatamente para isso, com licença MIT, uma base Llama de 0,5B parâmetros, e um controle de exagero para a entrega emocional — ao custo de precisar de uma GPU para fazer isso bem. A vantagem relatada do Chatterbox em relação ao ElevenLabs em avaliações cegas vale a pena conhecer, mas é uma alegação da própria Resemble AI, não um resultado verificado de forma independente, então pondere-a como evidência de marketing, não como um fato estabelecido. Para a maioria dos projetos de assistente de voz local e hardware embarcado, comece com o Piper; recorra ao Chatterbox somente quando clonar uma voz específica for uma exigência real, e combine este comparativo com a análise dedicada do Piper TTS ou a análise do XTTS v2 do PromptQuorum para um olhar mais profundo sobre qualquer um dos lados.

Fontes

  • OHF-Voice/piper1-gpl no GitHub — o repositório ativamente mantido do Piper: README, documentação, licença, histórico de versões.
  • rhasspy/piper no GitHub — o repositório original do Piper, hoje arquivado (licença MIT), arquivado em 6 de outubro de 2025.
  • resemble-ai/chatterbox no GitHub — o repositório oficial do Chatterbox: README, licença, documentação de instalação e uso.
  • Resemble AI: Chatterbox — a própria página da Resemble AI descrevendo a preferência relatada de avaliadores em teste cego em relação ao ElevenLabs via Podonos.
  • Análise do Piper TTS — a análise dedicada do PromptQuorum sobre o Piper, incluindo o histórico da mudança de licença de 2025.

← Voltar para LLMs locais avançados