Skip to main content
PromptQuorum
Início/LLMs locais avançados/XTTS v2: análise (2026) — clonagem de voz multilíngue a partir de 6 segundos de áudio
Voice, Speech & Multimodal

XTTS v2: análise (2026) — clonagem de voz multilíngue a partir de 6 segundos de áudio

·12 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

O XTTS v2 é um modelo de clonagem de voz multilíngue da Coqui que clona uma voz a partir de apenas 6 segundos de áudio de referência e gera fala nessa voz em 17 idiomas. Ele roda através do kit de ferramentas Coqui TTS (pip install coqui-tts, depois TTS("tts_models/multilingual/multi-dataset/xtts_v2")). Sua licença, a Coqui Public Model License (CPML), é não comercial — e como a Coqui AI, a empresa, encerrou seus serviços pagos em dezembro de 2023, atualmente não existe um caminho ativo para uma licença comercial. Para uma comparação completa de licenças entre motores de TTS locais, veja o guia de licenças de TTS local da PromptQuorum.

O XTTS v2 é um modelo de clonagem de voz multilíngue lançado pela Coqui, distribuído no Hugging Face, que clona uma voz a partir de apenas 6 segundos de áudio de referência e a faz falar em 17 idiomas. Ele roda através do kit de ferramentas Coqui TTS — o fork mantido ativamente é o idiap/coqui-ai-TTS — ou pode ser usado de forma independente pelos pesos do modelo. Esta análise cobre o que o XTTS v2 realmente faz, comandos de uso reais, sua licença (a Coqui Public Model License, CPML, não comercial) e onde ele é ou não a ferramenta certa, já que a Coqui AI, a empresa que o lançou originalmente, encerrou seus serviços pagos em dezembro de 2023.

XTTS v2: análise (2026) — clonagem de voz multilíngue a partir de 6 segundos de áudio

Principais conclusões

  • Clona uma voz a partir de apenas 6 segundos de áudio de referência, em 17 idiomas.
  • Roda pelo kit de ferramentas Coqui TTS (pip install coqui-tts) ou diretamente pelos pesos do modelo no Hugging Face.
  • Licença: Coqui Public Model License (CPML) — somente não comercial.
  • Sem caminho comercial ativo: a Coqui AI encerrou seus serviços pagos em dezembro de 2023.
  • Latência de streaming documentada abaixo de 200ms até o primeiro áudio; GPU fortemente recomendada.
  • Exige aceitar a CPML — defina COQUI_TOS_AGREED=1 para fazer isso de forma não interativa em Docker ou CI.

📍 Em uma frase

O XTTS v2 é o modelo de clonagem de voz multilíngue da Coqui que clona uma voz a partir de 6 segundos de áudio de referência e a faz falar em 17 idiomas, licenciado sob a Coqui Public Model License (CPML) não comercial, sem caminho comercial ativo desde que a Coqui AI, a empresa que o lançou, encerrou seus serviços pagos em dezembro de 2023.

💬 Em termos simples

É um modelo de IA que ouve um trecho curto de alguém falando e depois consegue gerar novas frases nessa mesma voz, em 17 idiomas diferentes — gratuito para uso pessoal e de pesquisa, mas não para um produto pago sem um acordo separado que atualmente não existe.

📌Nota: A CPML não é a mesma licença do kit de ferramentas Coqui TTS que executa o XTTS v2 — o kit é MPL-2.0, mas os pesos e as saídas deste modelo específico são não comerciais. Veja a seção Licença e uso comercial abaixo.

O que o XTTS v2 realmente faz

O XTTS v2 é um modelo de texto para fala com clonagem de voz entre idiomas, baseado em GPT. Dado um clipe de áudio de referência curto e um texto-alvo, ele gera fala na voz clonada, inclusive em um idioma diferente do áudio de referência.

  • Clonagem de voz em poucos segundos. Um único clipe de áudio de referência de 6 segundos é suficiente para clonar uma voz, segundo a ficha oficial da Coqui — nenhum ajuste fino ou treinamento é necessário para uma nova voz.
  • Suporte a 17 idiomas com clonagem entre idiomas. Os idiomas suportados são inglês, espanhol, francês, alemão, italiano, português, polonês, turco, russo, holandês, tcheco, árabe, chinês (zh-cn), japonês, húngaro, coreano e hindi — você pode clonar uma voz a partir de áudio em inglês e gerar fala em qualquer um dos outros 16 idiomas com essa mesma voz clonada.
  • Inferência por streaming. O XTTS v2 suporta síntese por streaming com latência abaixo de 200ms até o primeiro áudio, documentada desde que o recurso foi introduzido no Coqui TTS v0.20.0 — útil para aplicações de voz interativas em que esperar um arquivo de áudio completo é lento demais.
  • Roda pelo kit de ferramentas Coqui TTS. A forma principal e suportada de executar o XTTS v2 é através do Coqui TTS (pip install coqui-tts), que o expõe como TTS("tts_models/multilingual/multi-dataset/xtts_v2").
  • Reutilização de embedding de locutor. Além de passar um clipe de referência bruto a cada vez, o kit de ferramentas permite calcular e reutilizar o embedding latente de um locutor, evitando recálculo em sínteses repetidas com a mesma voz clonada.

Exemplos reais de uso

Estes comandos usam a API Python documentada do kit de ferramentas Coqui TTS, a forma principal e suportada de executar o XTTS v2.

  • A qualidade do áudio de referência importa. Um clipe limpo de 6 segundos de um único locutor, sem ruído de fundo ou música, produz um clone notavelmente melhor do que um clipe curto, ruidoso ou com vários locutores.
  • A aceitação não interativa da CPML é necessária na primeira vez que o XTTS v2 é carregado em um ambiente não supervisionado (Docker, CI) — defina COQUI_TOS_AGREED=1 antes desse primeiro carregamento.
python
# Instalar o kit de ferramentas
pip install coqui-tts

# Aceitar a CPML de forma não interativa (necessário para Docker/CI;
# caso contrário, aparece um prompt interativo no primeiro carregamento)
export COQUI_TOS_AGREED=1

# API Python: clonar uma voz e gerar fala
import torch
from TTS.api import TTS

device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)

# Clonagem no mesmo idioma
tts.tts_to_file(
    text="This is a cloned voice speaking a new sentence.",
    speaker_wav="reference_voice.wav",
    language="en",
    file_path="output_en.wav",
)

# Clonagem entre idiomas: clonar de áudio em inglês, falar em espanhol
tts.tts_to_file(
    text="Esta es la misma voz clonada, ahora hablando en español.",
    speaker_wav="reference_voice.wav",
    language="es",
    file_path="output_es.wav",
)

# Síntese por streaming (baixa latência até o primeiro áudio)
for chunk in tts.tts_stream(
    text="Streaming audio, chunk by chunk, for interactive use.",
    speaker_wav="reference_voice.wav",
    language="en",
):
    play_audio(chunk)

Licença e uso comercial

Os pesos do modelo e as saídas de áudio geradas pelo XTTS v2 são licenciados sob a Coqui Public Model License (CPML) 1.0.0, confirmado pelo arquivo de licença publicado junto ao modelo no Hugging Face. A CPML afirma explicitamente que "permite apenas o uso não comercial de um modelo de aprendizado de máquina e suas saídas" — usos permitidos incluem projetos pessoais, pesquisa acadêmica e trabalho como hobby, desde que você não receba remuneração direta ou indireta vinculada a esse uso.

Atualmente não existe um caminho comercial ativo para o XTTS v2. A ficha do modelo lista um endereço de contato, info@coqui.ai, para consultas de licenciamento comercial, mas a Coqui AI, a empresa, encerrou seus serviços pagos em dezembro de 2023 — a PromptQuorum não conseguiu confirmar que esse endereço está ativamente atendido ou que uma licença comercial pode ser obtida hoje. Trate o XTTS v2 como exclusivamente não comercial, a menos que confirme o contrário de forma independente antes de lançar um produto pago.

A CPML se aplica especificamente aos pesos do modelo XTTS v2 e suas saídas — não ao código do kit de ferramentas Coqui TTS que executa o modelo, que é licenciado separadamente sob a MPL-2.0 e permite uso comercial com condições de divulgação de código sobre modificações do kit. Este parágrafo explica a forma geral da licença; não é aconselhamento jurídico — leia a CPML você mesmo e consulte um advogado antes de qualquer implantação comercial.

Qual licença o XTTS v2 usa?

O XTTS v2 é lançado sob a Coqui Public Model License (CPML) 1.0.0, uma licença não comercial que se aplica aos pesos do modelo e suas saídas de áudio geradas. Ela permite uso pessoal, de pesquisa e hobby, mas proíbe o uso comercial — qualquer produto pago, ferramenta SaaS ou entrega a cliente — sem um acordo separado. Isso não é aconselhamento jurídico; leia a CPML você mesmo antes de qualquer uso comercial.

Para que o XTTS v2 não serve

O XTTS v2 é um modelo de clonagem de voz de alta qualidade, não um motor de TTS de uso geral pronto para implantação comercial. É a ferramenta errada para as seguintes situações:

  • Qualquer produto comercial sem uma licença confirmada. A CPML é não comercial, e atualmente não existe um caminho confirmado e ativo para uma licença comercial após o encerramento da Coqui AI em 2023. Não lance o XTTS v2 em um produto pago, aplicativo com anúncios ou entrega a cliente sem confirmar de forma independente os termos de licenciamento primeiro.
  • Uso em tempo real apenas com CPU e recursos limitados. O XTTS v2 suporta streaming de baixa latência, mas esse desempenho assume aceleração por GPU; apenas em CPU, ele é notavelmente mais lento que um motor leve como o Piper, e pode não ser prático para uso em tempo real em hardware modesto, como um Raspberry Pi.
  • Clonar uma voz a partir de áudio muito curto ou ruidoso. Embora 6 segundos seja o mínimo documentado, um clipe de referência ruidoso, comprimido ou com vários locutores produz um clone notavelmente pior do que uma gravação limpa de um único locutor.
  • Um idioma fora dos 17 suportados. O XTTS v2 suporta exatamente inglês, espanhol, francês, alemão, italiano, português, polonês, turco, russo, holandês, tcheco, árabe, chinês (zh-cn), japonês, húngaro, coreano e hindi — não há roteiro oficial para idiomas adicionais até a publicação desta análise.
  • Personificar alguém sem consentimento. Clonar a voz de uma pessoa real sem seu conhecimento ou consentimento levanta questões de consentimento, direito de imagem e potencialmente fraude ou personificação que são independentes da restrição não comercial da CPML — essas se aplicam independentemente dos termos de licença, tanto em uso pessoal quanto comercial.

Alternativas ao XTTS v2

Piper

Melhor uso:
Síntese apenas em CPU mais rápida, sem clonagem de voz, tempo real em um Raspberry Pi
Licença:
GPL-3.0-or-later

Kit de ferramentas Coqui TTS

Melhor uso:
O software que executa o XTTS v2 (e outros modelos) com uma base de código mais ampla e de licença permissiva
Licença:
MPL-2.0 (apenas o kit)

Bark

Melhor uso:
Áudio expressivo, não verbal — risadas, suspiros, som ambiente
Licença:
MIT

StyleTTS 2

Melhor uso:
Máxima qualidade de narração em inglês com som natural (sem clonagem de voz)
Licença:
MIT

ElevenLabs

Melhor uso:
API em nuvem gerenciada com clonagem de voz comercial e licenciamento comercial claro
Licença:
Proprietária (API em nuvem paga)

Perguntas frequentes

O que é o XTTS v2?

O XTTS v2 é um modelo de texto para fala com clonagem de voz multilíngue lançado pela Coqui, que clona uma voz a partir de apenas 6 segundos de áudio de referência e gera fala nessa voz em 17 idiomas, incluindo clonagem entre idiomas.

Posso usar o XTTS v2 comercialmente?

Não sem um acordo separado. O XTTS v2 é licenciado sob a Coqui Public Model License (CPML), que permite uso pessoal, de pesquisa e hobby, mas proíbe uso comercial — qualquer produto pago, SaaS, conteúdo com anúncios ou trabalho para clientes. A Coqui AI, a empresa que o lançou, encerrou seus serviços pagos em dezembro de 2023, e a PromptQuorum não conseguiu confirmar que existe hoje um caminho comercial ativo. Trate o XTTS v2 como exclusivamente não comercial.

Quanto áudio de referência o XTTS v2 precisa para clonar uma voz?

Apenas 6 segundos de áudio de referência limpo e de um único locutor, segundo sua ficha oficial no Hugging Face. Um clipe mais longo e limpo geralmente produz um clone mais preciso.

Quantos idiomas o XTTS v2 suporta?

Exatamente 17: inglês, espanhol, francês, alemão, italiano, português, polonês, turco, russo, holandês, tcheco, árabe, chinês (zh-cn), japonês, húngaro, coreano e hindi. Ele suporta clonagem entre idiomas — clone uma voz a partir de áudio em um desses idiomas e gere fala em qualquer um dos outros.

Como executo o XTTS v2?

Instale o kit de ferramentas Coqui TTS com pip install coqui-tts, depois carregue o modelo com TTS("tts_models/multilingual/multi-dataset/xtts_v2"). Defina primeiro a variável de ambiente COQUI_TOS_AGREED=1 se precisar aceitar a licença CPML de forma não interativa, como em um contêiner Docker ou pipeline de CI.

Preciso de uma GPU para executar o XTTS v2?

Uma GPU é fortemente recomendada. O XTTS v2 roda em CPU, mas de forma notavelmente mais lenta — sua latência de streaming documentada abaixo de 200ms assume aceleração por GPU, e o uso apenas em CPU não é prático para aplicações em tempo real.

Qual é a diferença entre o XTTS v2 e o kit de ferramentas Coqui TTS?

O XTTS v2 é um modelo específico de clonagem de voz, licenciado sob a CPML não comercial. O kit de ferramentas Coqui TTS é o software — um pacote Python e uma CLI — que executa o XTTS v2 e outros modelos, licenciado separadamente sob a MPL-2.0, que permite o uso comercial do código do kit em si.

Veredito

O XTTS v2 continua sendo um dos modelos de clonagem de voz local de maior qualidade disponíveis em 2026, e a combinação de um requisito de clonagem de 6 segundos, suporte a clonagem entre 17 idiomas e latência de streaming abaixo de 200ms é genuinamente capaz para uso pessoal, pesquisa e prototipagem. A decisão que realmente importa para a maioria dos leitores é a licença: a Coqui Public Model License é inequivocamente não comercial, e como a Coqui AI encerrou suas atividades em dezembro de 2023, não há hoje um caminho confirmado e ativo para uma licença comercial. Se o seu caso de uso é pessoal, acadêmico ou um protótipo não comercial, o XTTS v2 é uma escolha sólida e bem documentada. Se você precisa de clonagem de voz comercial, verifique os termos de licenciamento de forma independente antes de construir sobre ele, ou combine esta análise com a cobertura da PromptQuorum sobre Piper e Bark para alternativas com licença permissiva, ou a comparação com o ElevenLabs para uma opção comercial gerenciada.

Fontes

← Voltar para LLMs locais avançados