Chatterbox é um modelo de clonagem de voz open source gratuito, lançado pela Resemble AI em maio de 2025 sob licença MIT. Ele clona uma voz a partir de um curto clipe de referência, roda no seu próprio hardware e traz um controle ajustável de "exaggeration" para a intensidade emocional — um recurso que a maioria das plataformas TTS na nuvem não expõe diretamente. Uma versão multilíngue cobrindo 23 idiomas foi lançada em setembro de 2025.
ElevenLabs é uma plataforma de voz hospedada. Seus planos atuais reúnem texto para voz, clonagem de voz e outros recursos de voz/mídia sob créditos de uso compartilhados. O plano gratuito lista 10.000 créditos por mês; os planos pagos adicionam acesso a licença comercial e limites mais altos. Confira a página de preços em tempo real antes de confiar em qualquer valor, já que os provedores mudam planos e cotas de créditos sem aviso prévio.
A decisão não é "qual voz soa melhor?" — ambas podem soar convincentes. É: você quer um modelo gratuito que instala, opera e pelo qual é responsável, ou um serviço pago que tira de você o trabalho de infraestrutura em troca de uma mensalidade recorrente e limites de uso?
Nosso veredito
🏆 Melhor opção para um resultado profissional sem esforço hoje: ElevenLabs — sem instalação, vozes selecionadas, licenciamento comercial nos planos pagos. 💰 Melhor opção gratuita e auto-hospedada: Chatterbox — com licença MIT, custo recorrente zero assim que está funcionando. 🎭 Melhor opção para controlar a intensidade emocional: Chatterbox — seu controle de exaggeration não tem equivalente direto no ElevenLabs. 🔒 Melhor opção para clonagem de voz offline/isolada da rede: Chatterbox — a inferência permanece no seu próprio hardware depois que o modelo é baixado. ⚡ Melhor opção para conseguir uma locução ainda esta semana: ElevenLabs. 🧑💻 Melhor opção para desenvolvedores que querem inspecionar, ajustar ou auto-hospedar o modelo: Chatterbox.
Para a maioria dos criadores que precisam de resultado hoje e não querem gerenciar uma GPU, o ElevenLabs é o caminho mais rápido. Para desenvolvedores e equipes que querem um modelo gratuito, controlável e auto-hospedado — e estão confortáveis com uma GPU e um ambiente Python — o Chatterbox é a opção mais interessante.
Escolha sua abordagem de clonagem de voz
Use um LLM local se:
- •Você quer um modelo gratuito com licença MIT que possa inspecionar, modificar e rodar sem assinatura.
- •Você precisa de clonagem de voz offline ou isolada da rede e pode fornecer uma GPU para velocidade em tempo real.
- •Você quer controle direto sobre o parâmetro de emoção/exaggeration em vez de uma configuração gerenciada pela plataforma.
Use um modelo em nuvem se:
- •Você quer um clone de voz pronto hoje mesmo, sem instalação, sem GPU e sem gerenciar dependências.
- •Você precisa de vozes selecionadas e hospedadas, um fluxo de navegador/API e condições de licença comercial administradas pelo provedor.
- •Você está produzindo trabalho para cliente ou conteúdo com prazo de publicação.
Decisão rápida:
- →Para uma locução esta semana sem instalação: o ElevenLabs vence.
- →Para um modelo gratuito, auto-hospedado, acelerado por GPU e que você controla: o Chatterbox vence.
- →Para controle de intensidade emocional: só o Chatterbox expõe isso diretamente.
Principais conclusões
- Chatterbox é um modelo de clonagem de voz gratuito com licença MIT, de cerca de 0,5 bilhão de parâmetros, da Resemble AI, construído sobre uma arquitetura estilo Llama e lançado em maio de 2025; uma versão multilíngue com 23 idiomas veio em seguida, em setembro de 2025.
- ElevenLabs é uma plataforma paga e gerenciada na nuvem: Free (10.000 créditos/mês), Starter US$ 6/mês, Creator US$ 22/mês, Pro US$ 99/mês, Scale US$ 299/mês, Business US$ 990/mês — confirme os valores atuais na página de preços em tempo real.
- A Resemble AI relata que 63,75% dos avaliadores em testes cegos preferiram a saída do Chatterbox em vez da do ElevenLabs, em sua própria avaliação realizada via Podonos — esta é uma afirmação publicada pela fabricante Resemble AI, não um teste independente nem verificado pela PromptQuorum, e deve ser interpretada dessa forma.
- Chatterbox clona uma voz a partir de um curto clipe de referência e oferece um controle "exaggeration" para intensidade emocional; uma GPU é recomendada para geração em tempo real, e toda saída carrega uma marca d'água inaudível PerTh.
- ElevenLabs não exige hardware ou instalação local, oferece vozes selecionadas e condições de licença comercial nos planos pagos, e processa as solicitações por meio de sua própria infraestrutura em nuvem.
- Ambas as ferramentas clonam vozes a partir de um clipe curto — nunca clone, imite ou implante a voz de uma pessoa real sem permissão clara e salvaguardas adequadas.
Resumo geral
Situação | Melhor caminho | Por quê |
|---|---|---|
| Você precisa de uma locução clonada hoje, sem instalação | ElevenLabs | Sem instalação, sem GPU, sem download de modelo — crie uma conta e gere. |
| Você quer um modelo de clonagem de voz gratuito e auto-hospedado | Chatterbox | Licença MIT, sem assinatura, roda em hardware que você controla. |
| Você precisa de clonagem de voz offline ou isolada da rede | Chatterbox | A inferência pode ficar no seu próprio dispositivo depois que o modelo é baixado. |
| Você precisa de vozes selecionadas e licenciamento comercial resolvido | ElevenLabs | Os planos pagos já incluem acesso a licença comercial; você não revisa termos de modelo por conta própria. |
| Você quer controle direto sobre a intensidade emocional da saída | Chatterbox | O parâmetro exaggeration é ajustável diretamente; o ElevenLabs gerencia isso via configurações da plataforma. |
| Você não tem GPU ou não quer gerenciar uma | ElevenLabs | A geração roda na infraestrutura do ElevenLabs, não na sua. |
| Você precisa clonar uma voz para trabalho comercial | Compare com cuidado | Consentimento, termos do provedor e licenciamento importam nas duas opções. |
O que é o Chatterbox?
Chatterbox é um modelo gratuito de texto para voz e clonagem de voz, lançado pela Resemble AI em maio de 2025 sob licença MIT. O modelo original em inglês usa cerca de 0,5 bilhão de parâmetros sobre uma arquitetura de transformer estilo Llama. Uma versão multilíngue, Chatterbox Multilingual V3, veio em seguida, em setembro de 2025, e suporta 23 idiomas; uma variante menor e mais rápida, "Turbo" (cerca de 350 milhões de parâmetros), mira implantações com menor latência.
- Clonagem de voz zero-shot: o Chatterbox clona uma voz a partir de um curto clipe de referência — sem necessidade de ajuste fino (fine-tuning) nem conjunto de dados de treinamento.
- Controle de exaggeration: um parâmetro ajustável (padrão 0,5) regula a intensidade emocional, de plano/monótono a dramaticamente expressivo — um recurso que a maioria das plataformas TTS comerciais não expõe como controle direto.
- Licença MIT: gratuita para uso comercial, sem exigência de royalties ou participação na receita para a Resemble AI sobre o modelo em si — mesmo assim, confirme os termos de licença de qualquer voz de referência de terceiros que você usar.
- Marca d'água PerTh: toda saída de áudio carrega uma marca d'água inaudível que a Resemble AI diz ser projetada para sobreviver a processamentos de áudio comuns (compressão, edição), permitindo rastrear o áudio gerado até o modelo.
- Hardware: suporta CUDA (GPU NVIDIA), Apple Silicon (MPS) e inferência em CPU; uma GPU é recomendada para atingir velocidade de geração em tempo real.
•Key Point: Chatterbox é um modelo que você baixa e executa — via pacotes Python, uma interface web da comunidade ou um servidor auto-hospedado — não um produto hospedado com página de cadastro. Espere instalar dependências e gerenciar um ambiente Python/GPU.
O que a afirmação "Chatterbox supera o ElevenLabs" realmente diz?
A Resemble AI, empresa por trás do Chatterbox, relata que 63,75% dos avaliadores em testes cegos preferiram a saída do Chatterbox em vez da do ElevenLabs, em uma avaliação que a Resemble AI conduziu por meio da plataforma terceirizada Podonos. Este é um resultado publicado pela própria fabricante Resemble AI, não um estudo independente, e não é algo que a PromptQuorum tenha testado ou verificado — trate-o como qualquer benchmark divulgado por um fornecedor.
- Segundo a metodologia publicada pela Resemble AI, os dois sistemas geraram áudio a partir das mesmas entradas de texto, usando clipes de referência de 7 a 20 segundos, descritos como zero-shot, sem engenharia de prompt nem pós-processamento.
- Distribuição relatada pela Resemble AI: 38,75% preferiram fortemente o Chatterbox, 25% preferiram o Chatterbox, 8,75% não tiveram preferência, 16,25% preferiram o ElevenLabs e 11,25% preferiram fortemente o ElevenLabs.
- A comparação cobre uma única dimensão — a preferência de ouvintes em teste cego sobre os clipes testados, no momento dessa avaliação. Ela não cobre confiabilidade em escala, cobertura de idiomas além do conjunto testado, latência sob carga de produção, nem qualidade de narração longa.
- Testes de preferência às cegas desse tipo também são sensíveis ao texto, às vozes e aos clipes de referência escolhidos, e os resultados podem variar entre versões de modelo dos dois lados.
•Warning: Esta é uma afirmação da fabricante Resemble AI, apresentada aqui com sua metodologia declarada e um link completo para a fonte, para que você possa avaliá-la por conta própria — não é um resultado de teste da PromptQuorum e não deve ser tratada como um benchmark independente.
Publicidade
Pelo que você paga no ElevenLabs
Precisa de uma locução clonada até amanhã, sem GPU nem instalação? Comece com o plano gratuito do ElevenLabs — 10.000 créditos mensais, sem cartão. Testar o ElevenLabs grátis →
O ElevenLabs tira de você várias tarefas que auto-hospedar o Chatterbox deixaria sob sua responsabilidade:
Sem instalação local
- O que muda na prática:
- Você não gerencia GPU, ambiente Python nem pesos do modelo
Biblioteca de vozes selecionadas
- O que muda na prática:
- Você escolhe em um catálogo hospedado, em vez de conseguir e clonar seus próprios clipes de referência
Licenciamento comercial resolvido
- O que muda na prática:
- Os planos pagos incluem acesso a licença comercial; você não revisa termos de modelo por conta própria
Escalabilidade hospedada
- O que muda na prática:
- O ElevenLabs opera a infraestrutura em vez de você gerenciar capacidade de GPU e disponibilidade
Início mais rápido
- O que muda na prática:
- Você pode avaliar o fluxo no plano gratuito antes de investir em hardware local
•Key Point: O ElevenLabs lista atualmente: Free (US$ 0, 10.000 créditos/mês, sem licença comercial), Starter (US$ 6/mês, 30.000 créditos, licença comercial incluída), Creator (US$ 22/mês, 121.000 créditos), Pro (US$ 99/mês, 600.000 créditos, áudio a 192kbps), Scale (US$ 299/mês, 1.800.000 créditos) e Business (US$ 990/mês, 6.000.000 créditos). Planos Enterprise usam preço personalizado. O uso de texto para voz e clonagem de voz consome créditos compartilhados; o custo exato em créditos depende do modelo e do recurso usados — confirme os valores atuais na página de preços em tempo real antes de decidir.
•Key Point: Em 7 de maio de 2026, o ElevenLabs reduziu seus preços de API self-service — Text to Speech em até 55% — e introduziu créditos por uso (pay-as-you-go) para desenvolvedores que não querem assinatura mensal. Fonte: ElevenLabs — We've lowered API & Agents pricing and introduced PAYG.
O que realmente custa rodar o Chatterbox
O Chatterbox em si é gratuito sob licença MIT, mas "US$ 0 pelo modelo" é apenas um item do custo real de rodá-lo por conta própria:
Hardware
- O que significa:
- Uma GPU é recomendada para geração em tempo real; CPU e Apple Silicon (MPS) funcionam, mas visivelmente mais devagar
Instalação
- O que significa:
- É preciso configurar um ambiente Python, dependências e os pesos do modelo (ou um servidor/interface web da comunidade)
Preparação do clipe de referência
- O que significa:
- A clonagem de voz precisa de um clipe de referência limpo e curto e, para uso comercial, consentimento documentado
Atualizações do modelo
- O que significa:
- Novos checkpoints (Turbo, Multilingual V3 e lançamentos futuros) exigem que você mesmo acompanhe e teste de novo
Operação
- O que significa:
- Disponibilidade, armazenamento, logs e escalonamento para solicitações simultâneas são responsabilidade sua, não do provedor
Confiabilidade
- O que significa:
- Você assume os pontos de falha: conflitos de dependência, problemas de driver e latência sob carga
•Key Point: O Chatterbox troca uma assinatura recorrente do ElevenLabs por hardware e tempo de configuração antecipados, mais responsabilidade operacional contínua. É uma boa troca se você já tem uma GPU e quer um modelo gratuito, controlável e auto-hospedado; é uma má troca se você só precisa de uma locução antes de um prazo.
Chatterbox vs ElevenLabs: lado a lado
Dimensão | Chatterbox | ElevenLabs |
|---|---|---|
| Tipo de produto | Modelo open source auto-hospedado | Plataforma gerenciada na nuvem |
| Custo | Gratuito (licença MIT) | Plano gratuito + planos pagos a partir de US$ 6/mês |
| Instalação | Instalar software, baixar pesos, GPU recomendada | Criar conta e gerar — sem instalação |
| Clonagem de voz | Zero-shot a partir de um curto clipe de referência | Clonagem gerenciada em planos/recursos relevantes |
| Controle emocional | Parâmetro exaggeration direto | Configurações de voz gerenciadas pela plataforma |
| Exigência de internet | Nenhuma após a instalação — pode rodar totalmente offline | Requer conexão com o serviço |
| Processamento | Sua GPU/CPU (GPU recomendada para tempo real) | Operado pelo provedor |
| Marca d'água | Marca d'água PerTh inaudível em toda saída | Verifique a documentação atual da plataforma |
| Idiomas | 23 (Multilingual V3), menos no modelo base | Muitos (dezenas, depende da plataforma — verifique a documentação atual) |
| Uso comercial | Licença MIT; verifique os termos de qualquer voz de referência usada | Incluído nos planos pagos; verifique os termos atuais |
| Melhor uso | Desenvolvedores que querem um modelo gratuito, controlável e auto-hospedado | Criadores e equipes que precisam de resultado rápido e pronto, sem instalação |
Ambas as ferramentas clonam vozes a partir de um curto clipe de referência. Consentimento, licenciamento e obrigações de divulgação se aplicam nos dois caminhos — veja a seção Privacidade, consentimento e marca d'água abaixo.
Que hardware o Chatterbox realmente precisa?
Planejando comprar hardware para IA de voz local ou LLM? Veja nosso guia das melhores GPUs para IA local para recomendações de compra em diferentes orçamentos.
A Resemble AI não publica um único requisito mínimo oficial, e a VRAM relatada varia conforme a variante do Chatterbox usada e como ela é empacotada. Trate o que segue como orientação da comunidade, não como uma especificação garantida — teste com seu próprio hardware e carga de trabalho antes de se comprometer.
Hardware | Chatterbox (base/Multilingual) | Chatterbox-Turbo |
|---|---|---|
| Notebook só com CPU | Funciona, bem abaixo do tempo real | Mais rápido, pode se aproximar do tempo real em CPUs potentes |
| Apple Silicon (MPS) | Suportado, mais lento que uma GPU dedicada | Suportado, mais responsivo |
| GPU NVIDIA de 8–12GB | Bom — mínimo comumente relatado para uso fluido | Margem confortável |
| GPU classe RTX 4090 | Tempo real ou mais rápido | Latência abaixo de 200ms relatada pela Resemble AI |
Os valores acima vêm dos próprios materiais da Resemble AI e de guias de implantação da comunidade, não de um benchmark independente da PromptQuorum. O throughput real depende da variante do modelo, do tamanho do texto, do processamento em lote e das solicitações simultâneas — teste com seus próprios roteiros antes de comprar hardware.
Privacidade, consentimento e marca d'água
Rodar o Chatterbox localmente pode reduzir a quantidade de áudio e dados de referência enviados a terceiros, mas isso não cria conformidade legal automática, nem tira de você a responsabilidade sobre como uma voz clonada é usada. O ElevenLabs processa dados de voz de acordo com seus termos atuais e as configurações da sua conta — revise isso também antes de assumir qualquer coisa sobre privacidade.
- Você pode usar uma voz específica? Uma voz clonada pode envolver questões separadas de direitos, consentimento, contrato e personificação — independentemente de qual ferramenta produziu o clone.
- Para onde vão o áudio e o clipe de referência? O Chatterbox pode manter a inferência e os clipes de referência no seu próprio dispositivo, uma vez configurado dessa forma. O ElevenLabs processa solicitações de acordo com seus termos e infraestrutura atuais; confirme os detalhes que se aplicam à sua conta.
- A saída tem marca d'água? Toda saída do Chatterbox carrega a marca d'água inaudível PerTh da Resemble AI, que a empresa diz ser projetada para sobreviver a processamentos de áudio comuns e tornar o áudio gerado rastreável até o modelo. Verifique a documentação atual do ElevenLabs para seus próprios recursos de marca d'água ou proveniência.
•Warning: Nunca clone, imite ou implante a voz de uma pessoa real — com Chatterbox, ElevenLabs ou qualquer outra ferramenta — sem permissão clara e salvaguardas adequadas. Este artigo é orientação técnica, não aconselhamento jurídico.
Escolha o Chatterbox se
Um modelo auto-hospedado provavelmente se encaixa melhor se a maioria disto descreve você:
- Você quer um modelo de clonagem de voz gratuito com licença MIT, sem assinatura.
- Você precisa de clonagem de voz offline ou isolada da rede e pode fornecer uma GPU para velocidade em tempo real.
- Você quer controle direto sobre a intensidade emocional via parâmetro exaggeration.
- Você se sente confortável instalando dependências Python e gerenciando um ambiente GPU/modelo.
- Você quer inspecionar, modificar ou auto-hospedar o modelo, em vez de depender de um serviço terceirizado.
- Você está construindo um produto ou pipeline em que o preço de nuvem por solicitação se tornaria inviável no seu volume.
•Key Point: Chatterbox é um modelo, não um produto de consumo pronto — espere uma etapa de configuração antes do seu primeiro clipe gerado.
Escolha o ElevenLabs se
Uma plataforma gerenciada na nuvem se encaixa melhor se a maioria disto descreve você:
- Você precisa de um clone de voz com som profissional ainda esta semana, não de um projeto de infraestrutura local.
- Você não tem GPU ou não quer gerenciar uma para essa tarefa.
- Você publica vídeos, anúncios, cursos ou trabalho para clientes regularmente.
- Você quer que as condições de licença comercial sejam administradas pelo provedor, em vez de revisadas modelo a modelo.
- Você quer uma biblioteca de vozes selecionadas e ferramentas hospedadas em um único produto.
- Você está confortável usando uma plataforma terceirizada depois de revisar seus termos e práticas de dados atuais.
•Key Point: Comece grátis com 10.000 créditos mensais. Sem cartão de crédito. Teste hoje mesmo com seu próprio roteiro.
Um fluxo de teste sensato
Não decida com base em afirmações de marketing — inclusive o número do teste cego discutido acima. Gere o mesmo roteiro curto nas duas ferramentas e compare diretamente:
- Pronúncia de nomes, abreviações, números e palavras estrangeiras.
- Pausas naturais, ritmo e o quanto a configuração de exaggeration/emoção combina com o tom pretendido.
- Qualidade no formato de áudio que você realmente publica.
- Tempo do roteiro até uma tomada utilizável, incluindo repetições e, no caso do Chatterbox, o tempo de instalação/configuração.
- Se você consegue manter entradas e saídas dentro do ambiente exigido pelo seu projeto.
- Custo total: taxas de assinatura do ElevenLabs versus hardware, tempo de configuração e operação do Chatterbox.
- Exigências de consentimento e licenciamento para a voz específica que você planeja clonar.
•Key Point: Para a maioria dos prazos de conteúdo, o fator decisivo é o tempo até uma tomada publicável — não a qualidade bruta do modelo em um único benchmark relatado.
Perguntas frequentes
O Chatterbox é realmente gratuito para uso comercial?
Sim — o Chatterbox é lançado sob licença MIT, que permite uso comercial sem exigência de royalties ou participação na receita para a Resemble AI sobre o modelo em si. Você continua responsável pelo status de licença e consentimento de qualquer voz de referência usada como entrada, uma questão separada da licença do próprio modelo.
O Chatterbox realmente supera o ElevenLabs em testes cegos?
A Resemble AI, empresa por trás do Chatterbox, relata que 63,75% dos avaliadores em testes cegos preferiram sua saída em vez da do ElevenLabs, em uma avaliação que a Resemble AI conduziu via plataforma terceirizada Podonos. Esta é uma afirmação publicada pela própria Resemble AI, não um teste independente nem verificado pela PromptQuorum — leia a metodologia na fonte antes de tratá-la como decisiva para o seu caso de uso.
Quanta VRAM o Chatterbox precisa?
A Resemble AI não publica um mínimo oficial único, e os valores relatados pela comunidade variam conforme a variante e o empacotamento — geralmente entre 6 e 12GB para uso fluido em tempo real, com a variante Turbo precisando de menos. Teste com seu próprio hardware antes de se comprometer.
Posso rodar o Chatterbox sem GPU?
Sim. O Chatterbox suporta inferência em CPU e Apple Silicon (MPS), mas a geração é visivelmente mais lenta que o tempo real em hardware só com CPU. Uma GPU é recomendada se você precisa de saída em tempo real ou próxima disso.
Em que a clonagem de voz do Chatterbox difere da do ElevenLabs?
Ambas clonam uma voz a partir de um curto clipe de referência sem necessidade de treinamento. O Chatterbox executa a clonagem localmente no seu próprio hardware e expõe um parâmetro direto "exaggeration" para intensidade emocional. O ElevenLabs executa a clonagem na sua própria infraestrutura em nuvem e gerencia configurações de voz por meio da plataforma, em vez de um único parâmetro ajustável que você controla diretamente.
O áudio do Chatterbox tem marca d'água?
Sim. A Resemble AI incorpora sua marca d'água PerTh (Perceptual Threshold), descrita como inaudível e projetada para sobreviver a processamentos de áudio comuns como compressão e edição, em toda saída do Chatterbox, permitindo rastrear o áudio gerado até o modelo.
Quais idiomas o Chatterbox suporta?
O modelo original em inglês é apenas para esse idioma. O Chatterbox Multilingual V3, lançado em setembro de 2025, suporta 23 idiomas. Verifique a documentação atual da Resemble AI para a lista exata, já que o suporte a idiomas pode se expandir com novos lançamentos.
O ElevenLabs é melhor que o Chatterbox para narração no YouTube?
Para a maioria dos criadores que querem uma voz pronta sem instalação local, o ElevenLabs é o caminho mais rápido — ele oferece planos de texto para voz com acesso a licença comercial nos níveis pagos. O Chatterbox é uma alternativa viável se você já tem uma GPU, quer custo recorrente zero e está confortável com uma etapa de configuração. Verifique nos dois casos os termos exatos do plano e as práticas de divulgação antes de publicar conteúdo monetizado.
Posso clonar a voz de outra pessoa com Chatterbox ou ElevenLabs?
Somente com permissão clara dessa pessoa e salvaguardas adequadas. Ambas as ferramentas tornam a clonagem de voz tecnicamente simples a partir de um curto clipe de referência, mas nem a licença do modelo nem os termos de serviço de uma plataforma substituem o consentimento da pessoa cuja voz você está clonando. Isto é orientação técnica, não aconselhamento jurídico.
Qual é mais barato em alto volume, Chatterbox ou ElevenLabs?
Depende do seu uso real e do hardware que você já possui. O preço por créditos medido por uso do ElevenLabs escala com o volume, enquanto o custo do Chatterbox é sobretudo antecipado (GPU, tempo de configuração) mais a operação contínua assim que está funcionando. Calcule com seu volume real de solicitações, não um hipotético, antes de trocar em qualquer direção.
