Skip to main content
PromptQuorum
Início/LLMs locais avançados/O Melhor Motor de TTS Local para uma GPU NVIDIA (2026)
Voice, Speech & Multimodal

O Melhor Motor de TTS Local para uma GPU NVIDIA (2026)

·13 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

Se você tem uma GPU NVIDIA, o XTTS v2 é o melhor motor de TTS local para clonagem de voz, o Chatterbox é o melhor para clonagem conversacional em tempo real, e o Bark é o melhor para áudio expressivo não vocal — o Kokoro continua sendo a escolha certa se suas necessidades forem simples, já que ele quase não precisa da GPU. Os três motores voltados para GPU (XTTS v2, Chatterbox, Bark) também rodam em CPU, mas de forma perceptivelmente mais lenta; a aceleração CUDA é o que os torna práticos para uso em tempo real ou em lote. Qual instalar depende de você precisar de clonagem de voz, de quanta VRAM sobra e de a licença ser adequada a um projeto comercial.

Se você já tem uma GPU NVIDIA, os motores locais de conversão de texto em fala que valem a pena rodar são diferentes das opções somente-CPU que a maioria dos guias recomenda por padrão. XTTS v2, Chatterbox e Bark trocam velocidade de CPU por qualidade de clonagem de voz e expressividade, algo que só faz sentido de verdade com aceleração CUDA disponível — e o Kokoro entra aqui justamente como contraponto, porque ter uma GPU não significa automaticamente precisar do modelo mais pesado. Este guia compara os quatro em requisitos de VRAM, quanto cada um realmente se beneficia da CUDA, capacidade de clonagem de voz e licença, para que você escolha o motor certo para seu hardware e seu caso de uso real, em vez do que tem o vídeo de demonstração mais chamativo.

O Melhor Motor de TTS Local para uma GPU NVIDIA (2026)

Principais conclusões

  • XTTS v2: melhor qualidade de clonagem (clipe de referência de 6 segundos, 17 idiomas), 4-6 GB de VRAM recomendados, licença CPML não comercial.
  • Chatterbox: clonagem conversacional em tempo real, modelo pequeno com ~0,5B de parâmetros, licença MIT (uso comercial permitido).
  • Bark: sons expressivos não vocais, sem clonagem de voz, maior consumo de VRAM entre os quatro, licença MIT, manutenção incerta.
  • Kokoro: 82M de parâmetros, Apache 2.0, roda bem só com CPU — o contraponto que dispensa GPU.
  • Os três motores voltados para GPU rodam em CPU, mas com um custo real de velocidade — essa diferença é a própria razão de ter uma GPU para esse caso de uso.
  • A clonagem de voz exige o consentimento da pessoa clonada, independentemente do motor ou da licença que você usar.

📍 Em uma frase

Em uma GPU NVIDIA, o XTTS v2 oferece a melhor qualidade de clonagem de voz, o Chatterbox a melhor clonagem conversacional em tempo real sob uma licença MIT apta para uso comercial, o Bark o áudio não vocal mais expressivo, e o Kokoro continua sendo a escolha certa quando uma GPU não é realmente necessária.

💬 Em termos simples

Se você tem uma placa de vídeo capaz de rodar cargas de trabalho de IA, três motores de conversão de texto em fala (XTTS v2, Chatterbox, Bark) realmente ficam mais rápidos e melhores por causa dela, enquanto um quarto (Kokoro) quase não precisa da GPU — qual instalar depende de você precisar de clonagem de voz, de quanta memória de vídeo você tem e se pretende usá-lo comercialmente.

📌Nota: Este guia parte do princípio de que você já tem uma GPU NVIDIA e está decidindo o que rodar nela. Para uma configuração somente-CPU (Raspberry Pi, sem GPU dedicada), o Piper é a escolha padrão — veja o comparativo completo de licenças e VRAM da PromptQuorum para todos os motores de TTS locais, linkado em Leituras relacionadas.

Quais motores realmente precisam de uma GPU?

O XTTS v2, o Chatterbox e o Bark rodam todos em CPU, mas é uma GPU que os torna práticos para uso em tempo real ou em lote — o Kokoro é a exceção, já que seus 82 milhões de parâmetros o tornam rápido só com CPU. Os três motores mais pesados compartilham uma característica: são modelos priorizando qualidade de clonagem ou de geração, cuja arquitetura troca poder de processamento por expressividade, de modo que a aceleração CUDA remove o gargalo em vez de trazer apenas uma melhora marginal.

Use um motor voltado para GPU (XTTS v2, Chatterbox ou Bark) se seu caso de uso for clonagem de voz, áudio expressivo não vocal, ou qualquer tarefa em que a velocidade de geração importe — um trabalho de narração em lote, uma aplicação de voz interativa, ou um pipeline que gera muitos clipes. Evite gastar VRAM de GPU com TTS se sua única necessidade for narração simples de texto puro sem clonagem: o Kokoro ou o Piper cobrem esse caso só com CPU, liberando sua VRAM para um LLM ou outra tarefa rodando em paralelo.

  • O XTTS v2 roda em CPU, mas é documentado como perceptivelmente mais lento nela — sua latência de streaming abaixo de 200 ms é um valor com aceleração por GPU, não um valor de CPU.
  • O Chatterbox traz uma variante Nano compatível com CPU (110M de parâmetros) que a própria documentação da Resemble AI descreve como mais rápida que tempo real em 8 núcleos de CPU, mas as variantes maiores voltadas para clonagem se beneficiam da CUDA para uso conversacional em tempo real.
  • O Bark afirma explicitamente em sua própria documentação que a inferência em CPU ou GPUs mais antigas pode ser significativamente mais lenta do que a velocidade próxima do tempo real que ele alcança em GPUs de nível corporativo.
  • O Kokoro é a exceção: com 82 milhões de parâmetros, roda em velocidade de tempo real ou mais rápido só com CPU, segundo sua própria ficha de modelo no Hugging Face, e só precisa de uma GPU para folga extra em geração em lote de alto volume.

XTTS v2: melhor qualidade de clonagem de voz

O XTTS v2, lançado pela Coqui e executado por meio do kit de ferramentas Coqui TTS, é a melhor opção de clonagem de voz local para quem tem GPU e precisa da maior qualidade alcançável a partir de um clipe de referência curto. Ele clona uma voz a partir de apenas 6 segundos de áudio de referência e a reproduz em 17 idiomas, incluindo clonagem entre idiomas — clonar uma voz a partir de áudio em inglês e falar o resultado em espanhol ou japonês.

Em termos de VRAM, os pesos do modelo do XTTS v2 têm cerca de 2 GB, mas 4 GB é o mínimo prático para rodá-lo, e 4-6 GB são recomendados para inferência em tempo real, segundo a análise do XTTS v2 dedicada da PromptQuorum. A licença é o fator decisivo para a maioria dos leitores: a Coqui Public Model License (CPML) é explicitamente não comercial, e como a Coqui AI, a empresa, encerrou seus serviços pagos em dezembro de 2023, atualmente não há um caminho confirmado para uma licença comercial.

  • Use o XTTS v2 se: seu projeto for pessoal, acadêmico ou um protótipo não comercial e você quiser a melhor qualidade de clonagem disponível localmente.
  • Evite o XTTS v2 se: você precisar de uma licença comercial — seus termos CPML são não comerciais, sem caminho de licenciamento ativo confirmado desde o fechamento da Coqui AI em 2023.
  • VRAM: ~2 GB de pesos do modelo, 4 GB no mínimo, 4-6 GB recomendados para inferência em tempo real.
  • Ideal para: clonagem de voz local da mais alta fidelidade, suporte multilíngue cruzado a 17 idiomas, uso não comercial ou de pesquisa.

Chatterbox: melhor clonagem em tempo real

O Chatterbox, lançado pela Resemble AI no GitHub, é a melhor escolha para quem tem GPU e quer clonagem de voz conversacional em tempo real sob uma licença totalmente permissiva e apta para uso comercial. Ele está sob a licença MIT, que — diferentemente da CPML não comercial do XTTS v2 — permite uso comercial sem um acordo separado.

O Chatterbox vem em vários tamanhos: uma variante Nano (110 milhões de parâmetros) que a própria documentação da Resemble AI descreve como mais rápida que tempo real em 8 núcleos de CPU, uma variante Turbo (350 milhões de parâmetros) construída para baixa latência, e uma variante multilíngue (cerca de 500 milhões de parâmetros, sobre uma arquitetura que credita o Llama 3) com suporte a mais de 20 idiomas. A clonagem de voz zero-shot funciona a partir de um clipe de áudio de referência — o exemplo oficial da Resemble AI usa um clipe de 10 segundos, embora o README não informe uma duração mínima oficial como o do XTTS v2.

O README público da Resemble AI não publica um valor exato de VRAM, então trate qualquer número específico em GB que você veja em outro lugar como não verificado até testá-lo na sua própria placa. O que está documentado: a variante Nano roda de forma aceitável só com CPU, enquanto as variantes maiores Turbo e Multilingual são construídas para geração acelerada por GPU e de baixa latência — tanto CUDA quanto Apple Silicon (MPS) são compatíveis.

  • Use o Chatterbox se: você precisar de clonagem de voz apta para uso comercial com latência em tempo real ou quase em tempo real, como em uma aplicação de voz interativa.
  • Evite o Chatterbox se: você precisar de um valor mínimo de VRAM documentado e garantido antes de comprar hardware — a Resemble AI não publicou um.
  • VRAM: não publicado oficialmente; a variante Nano, menor, é compatível com CPU, enquanto as variantes Turbo e Multilingual visam a aceleração por GPU para velocidade de tempo real.
  • Ideal para: produtos comerciais que precisam de clonagem de voz conversacional zero-shot sob uma licença permissiva.
  • Toda saída do Chatterbox carrega a marca d'água Perth própria da Resemble AI, descrita em sua documentação como uma marca d'água neural imperceptível que sobrevive à compressão MP3 — um sinal de proveniência embutido, não um substituto para o consentimento (veja a seção Clonagem de voz e consentimento abaixo).

Bark: melhor áudio expressivo não vocal

O Bark, lançado pela Suno no GitHub, é a escolha certa se você quiser mais do que fala — risadas, suspiros, arfadas e música simples geradas apenas a partir de prompts de texto — e é o motor deste comparativo que mais se beneficia de uma GPU, já que sua arquitetura generativa, token por token, é a mais lenta dos quatro sem aceleração CUDA. Ele não suporta clonagem de voz personalizada; segundo a própria documentação da Suno, ele "atualmente não suporta clonagem de voz personalizada".

Em termos de VRAM, a análise do Bark dedicada da PromptQuorum documenta que o modelo completo precisa de cerca de 12 GB, com uma flag de ambiente para modelo pequeno (SUNO_USE_SMALL_MODELS) reduzindo isso para cerca de 8 GB — perceptivelmente mais do que os 4-6 GB do XTTS v2. Ele está sob licença MIT, totalmente apta para uso comercial desde 1º de maio de 2023, mas seu status de manutenção é uma questão real em aberto: o repositório público no GitHub não mostra commits desde 5 de abril de 2024.

  • Use o Bark se: você precisar de áudio não vocal (risadas, suspiros, som ambiente) além da fala e tiver 8-12 GB de VRAM disponíveis.
  • Evite o Bark se: você precisar de saída confiável e determinística para um pipeline de produção, ou precisar de clonagem de voz — o Bark não a suporta.
  • VRAM: ~12 GB para o modelo completo, ~8 GB com a flag de modelo pequeno — o mais pesado dos quatro motores comparados aqui.
  • Ideal para: geração de áudio expressivo, efeitos sonoros combinados com fala, prototipagem e uso em pesquisa.

Kokoro: quando uma GPU é excessiva

O Kokoro entra aqui como contraponto: ter uma GPU NVIDIA não significa que toda carga de trabalho de TTS precise de uma, e o Kokoro prova isso. Com 82 milhões de parâmetros, ele é drasticamente menor que o XTTS v2, o Chatterbox ou o Bark, e sua própria ficha de modelo no Hugging Face documenta síntese em tempo real ou mais rápida só com CPU, com o uso de GPU adicionando folga em vez de ser um requisito.

O Kokoro está sob licença Apache 2.0, que — assim como a licença MIT do Chatterbox — permite uso comercial sem restrições. Ele não suporta clonagem de voz, então não substitui o XTTS v2 ou o Chatterbox quando a clonagem é o requisito, mas para narração simples, leitura de texto em voz alta, ou uma camada de voz em um aplicativo em que a clonagem não é necessária, ele é uma escolha mais leve e mais simples.

  • Use o Kokoro se: sua carga de trabalho for narração simples ou leitura de texto em voz alta, você quiser manter a VRAM da sua GPU livre para um LLM ou outra tarefa, ou precisar de uma implantação somente-CPU.
  • Evite o Kokoro se: você precisar de clonagem de voz — ele não a suporta, use o XTTS v2 ou o Chatterbox em vez disso.
  • VRAM: aproximadamente 2 GB quando rodado em GPU; roda em velocidade de tempo real só com CPU, segundo sua própria ficha de modelo.
  • Ideal para: narração simples e casos de leitura de texto em voz alta em que os motores de clonagem mais pesados seriam realmente excessivos.

Tabela comparativa de adequação à GPU

Esta tabela pontua os quatro motores especificamente em critérios de adequação à GPU — requisito de VRAM, quanto cada um se beneficia da aceleração CUDA, capacidade de clonagem de voz e licença — não na qualidade bruta do áudio.

📍 Em uma frase

O XTTS v2 é melhor para a clonagem de voz de mais alta qualidade; o Chatterbox é melhor para clonagem conversacional comercial em tempo real; o Bark é melhor para áudio expressivo não vocal; o Kokoro é melhor quando nenhuma clonagem é necessária e uma GPU seria desperdiçada na tarefa.

Motor
VRAM (GPU)
Ganho de velocidade com GPU
Clonagem de voz
Licença
XTTS v24-6 GB recomendadosGrande — CPU pouco práticoSim, clipe 6s / 17 idiomasCPML (não comercial)
ChatterboxNão publicado oficialmenteGrande para uso em tempo realSim, zero-shotMIT
Bark~8-12 GB (pequeno/completo)O maior dos quatroNãoMIT
Kokoro~2 GB, GPU opcionalPequeno — rápido mesmo em CPUNãoApache 2.0

Quanta VRAM você realmente precisa?

Uma GPU com 6 GB de VRAM ou mais cobre confortavelmente todos os motores deste comparativo, exceto o modelo completo do Bark, que precisa de cerca de 12 GB (ou cerca de 8 GB com sua flag de modelo pequeno). Combine sua placa com o motor que você realmente precisa, em vez de comprar por padrão a opção mais pesada.

Para orientação geral sobre como escolher uma GPU por faixa de VRAM para cargas de trabalho de IA local (não específico para TTS), veja o guia de compra de GPU para LLMs locais da PromptQuorum — a mesma lógica de compra centrada em VRAM se aplica ao TTS, e se você já roda um LLM local junto com TTS, as duas cargas de trabalho disputam o mesmo pool de VRAM.

  • GPU de entrada (6-8 GB de VRAM): cobre o XTTS v2 confortavelmente, cobre o Bark só com a flag de modelo pequeno, cobre o Kokoro e as variantes menores do Chatterbox com facilidade.
  • GPU intermediária (12 GB ou mais de VRAM): cobre os quatro motores, incluindo o modelo completo do Bark, com folga para outras cargas de trabalho.
  • Rodar TTS junto com um LLM local: reserve VRAM para os dois — um LLM 7B com quantização Q4 precisa por si só de cerca de 4-5 GB, então combine-o com o XTTS v2 ou o Kokoro em vez do modelo completo do Bark, a menos que sua placa tenha 16 GB ou mais.
  • Na dúvida, comece com o Kokoro ou o XTTS v2 — ambos cabem confortavelmente em 6 GB de VRAM, deixando espaço para adicionar um motor mais pesado depois, se seu caso de uso crescer.

Perguntas frequentes

Preciso de uma GPU NVIDIA para rodar motores de TTS locais?

Não. O Kokoro roda em velocidade de tempo real só com CPU, e o XTTS v2, o Chatterbox e o Bark também rodam em CPU — só que perceptivelmente mais devagar. Uma GPU é o que torna esses três práticos para uso em tempo real ou em lote, não um requisito rígido para rodá-los.

Qual motor de TTS local tem a melhor clonagem de voz?

O XTTS v2, lançado pela Coqui, é a opção de clonagem de voz de maior qualidade abordada aqui — ele clona uma voz a partir de apenas 6 segundos de áudio de referência em 17 idiomas. Sua licença, a Coqui Public Model License (CPML), é não comercial. O Chatterbox, lançado pela Resemble AI sob licença MIT, é a melhor escolha se você precisar de clonagem apta para uso comercial com latência conversacional em tempo real.

Quanta VRAM o XTTS v2 precisa?

Os pesos do modelo do XTTS v2 têm cerca de 2 GB; 4 GB é o mínimo prático para rodá-lo, e 4-6 GB são recomendados para inferência em tempo real, segundo a análise do XTTS v2 dedicada da PromptQuorum.

Quanta VRAM o Bark precisa?

O modelo completo do Bark precisa de cerca de 12 GB de VRAM; definir a flag de ambiente SUNO_USE_SMALL_MODELS reduz isso para cerca de 8 GB. É o mais pesado dos quatro motores comparados neste guia.

Posso usar o Chatterbox comercialmente?

Sim. O Chatterbox, lançado pela Resemble AI, está sob licença MIT, que permite uso comercial sem um acordo separado — diferentemente da licença CPML não comercial do XTTS v2.

Uma GPU é excessiva para TTS local?

Depende do seu caso de uso. Se você só precisar de narração simples ou leitura de texto em voz alta sem clonagem de voz, o Kokoro (82M de parâmetros, Apache 2.0) roda em velocidade de tempo real só com CPU, e comprar ou dedicar uma GPU para essa tarefa é desnecessário. Se você precisar de clonagem de voz ou áudio expressivo não vocal, uma GPU melhora sensivelmente o XTTS v2, o Chatterbox e o Bark.

Qual é a diferença entre o XTTS v2 e o Chatterbox?

O XTTS v2 geralmente produz clones de maior fidelidade e suporta 17 idiomas com clonagem entre idiomas, mas sua licença CPML é não comercial. O Chatterbox é um modelo menor (cerca de 0,5 bilhão de parâmetros em sua variante Multilingual) construído para latência conversacional em tempo real, e sua licença MIT permite uso comercial.

O Bark suporta clonagem de voz?

Não. Segundo a própria documentação da Suno, o Bark "atualmente não suporta clonagem de voz personalizada". Ele pode gerar áudio expressivo — risadas, suspiros, música simples — com predefinições de voz selecionáveis, mas não consegue clonar a voz de uma pessoa qualquer a partir de uma gravação de referência como o XTTS v2 ou o Chatterbox conseguem.

Posso rodar TTS e um LLM local na mesma GPU?

Sim, se você reservar VRAM para os dois. Um LLM 7B com quantização Q4 precisa por si só de cerca de 4-5 GB, então combiná-lo com o XTTS v2 (4-6 GB) ou o Kokoro (~2 GB) cabe confortavelmente em uma placa de 12 GB; combinar um LLM com o modelo completo do Bark (~12 GB) geralmente precisa de 16 GB ou mais de VRAM no total.

Preciso de consentimento para clonar a voz de alguém, mesmo em um projeto pessoal?

Sim. Clonar a voz de uma pessoa real sem seu consentimento explícito e documentado levanta questões de consentimento e direito de imagem, independentemente de o projeto ser pessoal ou comercial, e independentemente da licença do motor usado. Esta é uma observação factual, não um aconselhamento jurídico.

Veredito

Para leitores que já têm uma GPU NVIDIA e querem usá-la para conversão de texto em fala, a escolha depende do que o áudio precisa fazer. O XTTS v2 é a escolha para a mais alta qualidade de clonagem de voz alcançável em um contexto não comercial ou de pesquisa, dada sua licença CPML não comercial. O Chatterbox é a escolha quando essa mesma capacidade de clonagem precisa ser entregue em um produto comercial, graças à sua licença MIT e aos tamanhos de modelo menores voltados para tempo real. O Bark é a escolha especificamente quando o projeto precisa de áudio expressivo não vocal — risadas, suspiros, música simples — e pode gastar 8-12 GB de VRAM para consegui-lo, com a ressalva de que seu status de manutenção é incerto. O Kokoro continua sendo a escolha certa sempre que a clonagem não for o requisito: ele roda confortavelmente só com CPU, então reservar VRAM de GPU para ele raramente vale a pena. Na dúvida, comece com o Kokoro para narração simples e migre para o XTTS v2 ou o Chatterbox só quando surgir um requisito real de clonagem — isso mantém a VRAM da sua GPU disponível para o que mais você estiver rodando junto, inclusive um LLM local. Para os detalhes de licença de cada motor mencionado aqui, veja o guia de licenças de TTS e clonagem de voz locais da PromptQuorum.

Fontes

← Voltar para LLMs locais avançados