Principais conclusões
- Clona uma voz a partir de apenas 6 segundos de áudio de referência, em 17 idiomas.
- Roda pelo kit de ferramentas Coqui TTS (
pip install coqui-tts) ou diretamente pelos pesos do modelo no Hugging Face. - Licença: Coqui Public Model License (CPML) — somente não comercial.
- Sem caminho comercial ativo: a Coqui AI encerrou seus serviços pagos em dezembro de 2023.
- Latência de streaming documentada abaixo de 200ms até o primeiro áudio; GPU fortemente recomendada.
- Exige aceitar a CPML — defina
COQUI_TOS_AGREED=1para fazer isso de forma não interativa em Docker ou CI.
📍 Em uma frase
O XTTS v2 é o modelo de clonagem de voz multilíngue da Coqui que clona uma voz a partir de 6 segundos de áudio de referência e a faz falar em 17 idiomas, licenciado sob a Coqui Public Model License (CPML) não comercial, sem caminho comercial ativo desde que a Coqui AI, a empresa que o lançou, encerrou seus serviços pagos em dezembro de 2023.
💬 Em termos simples
É um modelo de IA que ouve um trecho curto de alguém falando e depois consegue gerar novas frases nessa mesma voz, em 17 idiomas diferentes — gratuito para uso pessoal e de pesquisa, mas não para um produto pago sem um acordo separado que atualmente não existe.
📌Nota: A CPML não é a mesma licença do kit de ferramentas Coqui TTS que executa o XTTS v2 — o kit é MPL-2.0, mas os pesos e as saídas deste modelo específico são não comerciais. Veja a seção Licença e uso comercial abaixo.
O que o XTTS v2 realmente faz
O XTTS v2 é um modelo de texto para fala com clonagem de voz entre idiomas, baseado em GPT. Dado um clipe de áudio de referência curto e um texto-alvo, ele gera fala na voz clonada, inclusive em um idioma diferente do áudio de referência.
- Clonagem de voz em poucos segundos. Um único clipe de áudio de referência de 6 segundos é suficiente para clonar uma voz, segundo a ficha oficial da Coqui — nenhum ajuste fino ou treinamento é necessário para uma nova voz.
- Suporte a 17 idiomas com clonagem entre idiomas. Os idiomas suportados são inglês, espanhol, francês, alemão, italiano, português, polonês, turco, russo, holandês, tcheco, árabe, chinês (zh-cn), japonês, húngaro, coreano e hindi — você pode clonar uma voz a partir de áudio em inglês e gerar fala em qualquer um dos outros 16 idiomas com essa mesma voz clonada.
- Inferência por streaming. O XTTS v2 suporta síntese por streaming com latência abaixo de 200ms até o primeiro áudio, documentada desde que o recurso foi introduzido no Coqui TTS v0.20.0 — útil para aplicações de voz interativas em que esperar um arquivo de áudio completo é lento demais.
- Roda pelo kit de ferramentas Coqui TTS. A forma principal e suportada de executar o XTTS v2 é através do Coqui TTS (
pip install coqui-tts), que o expõe comoTTS("tts_models/multilingual/multi-dataset/xtts_v2"). - Reutilização de embedding de locutor. Além de passar um clipe de referência bruto a cada vez, o kit de ferramentas permite calcular e reutilizar o embedding latente de um locutor, evitando recálculo em sínteses repetidas com a mesma voz clonada.
Exemplos reais de uso
Estes comandos usam a API Python documentada do kit de ferramentas Coqui TTS, a forma principal e suportada de executar o XTTS v2.
- A qualidade do áudio de referência importa. Um clipe limpo de 6 segundos de um único locutor, sem ruído de fundo ou música, produz um clone notavelmente melhor do que um clipe curto, ruidoso ou com vários locutores.
- A aceitação não interativa da CPML é necessária na primeira vez que o XTTS v2 é carregado em um ambiente não supervisionado (Docker, CI) — defina
COQUI_TOS_AGREED=1antes desse primeiro carregamento.
# Instalar o kit de ferramentas
pip install coqui-tts
# Aceitar a CPML de forma não interativa (necessário para Docker/CI;
# caso contrário, aparece um prompt interativo no primeiro carregamento)
export COQUI_TOS_AGREED=1
# API Python: clonar uma voz e gerar fala
import torch
from TTS.api import TTS
device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)
# Clonagem no mesmo idioma
tts.tts_to_file(
text="This is a cloned voice speaking a new sentence.",
speaker_wav="reference_voice.wav",
language="en",
file_path="output_en.wav",
)
# Clonagem entre idiomas: clonar de áudio em inglês, falar em espanhol
tts.tts_to_file(
text="Esta es la misma voz clonada, ahora hablando en español.",
speaker_wav="reference_voice.wav",
language="es",
file_path="output_es.wav",
)
# Síntese por streaming (baixa latência até o primeiro áudio)
for chunk in tts.tts_stream(
text="Streaming audio, chunk by chunk, for interactive use.",
speaker_wav="reference_voice.wav",
language="en",
):
play_audio(chunk)Licença e uso comercial
Os pesos do modelo e as saídas de áudio geradas pelo XTTS v2 são licenciados sob a Coqui Public Model License (CPML) 1.0.0, confirmado pelo arquivo de licença publicado junto ao modelo no Hugging Face. A CPML afirma explicitamente que "permite apenas o uso não comercial de um modelo de aprendizado de máquina e suas saídas" — usos permitidos incluem projetos pessoais, pesquisa acadêmica e trabalho como hobby, desde que você não receba remuneração direta ou indireta vinculada a esse uso.
Atualmente não existe um caminho comercial ativo para o XTTS v2. A ficha do modelo lista um endereço de contato, info@coqui.ai, para consultas de licenciamento comercial, mas a Coqui AI, a empresa, encerrou seus serviços pagos em dezembro de 2023 — a PromptQuorum não conseguiu confirmar que esse endereço está ativamente atendido ou que uma licença comercial pode ser obtida hoje. Trate o XTTS v2 como exclusivamente não comercial, a menos que confirme o contrário de forma independente antes de lançar um produto pago.
A CPML se aplica especificamente aos pesos do modelo XTTS v2 e suas saídas — não ao código do kit de ferramentas Coqui TTS que executa o modelo, que é licenciado separadamente sob a MPL-2.0 e permite uso comercial com condições de divulgação de código sobre modificações do kit. Este parágrafo explica a forma geral da licença; não é aconselhamento jurídico — leia a CPML você mesmo e consulte um advogado antes de qualquer implantação comercial.
Qual licença o XTTS v2 usa?
O XTTS v2 é lançado sob a Coqui Public Model License (CPML) 1.0.0, uma licença não comercial que se aplica aos pesos do modelo e suas saídas de áudio geradas. Ela permite uso pessoal, de pesquisa e hobby, mas proíbe o uso comercial — qualquer produto pago, ferramenta SaaS ou entrega a cliente — sem um acordo separado. Isso não é aconselhamento jurídico; leia a CPML você mesmo antes de qualquer uso comercial.
Para que o XTTS v2 não serve
O XTTS v2 é um modelo de clonagem de voz de alta qualidade, não um motor de TTS de uso geral pronto para implantação comercial. É a ferramenta errada para as seguintes situações:
- Qualquer produto comercial sem uma licença confirmada. A CPML é não comercial, e atualmente não existe um caminho confirmado e ativo para uma licença comercial após o encerramento da Coqui AI em 2023. Não lance o XTTS v2 em um produto pago, aplicativo com anúncios ou entrega a cliente sem confirmar de forma independente os termos de licenciamento primeiro.
- Uso em tempo real apenas com CPU e recursos limitados. O XTTS v2 suporta streaming de baixa latência, mas esse desempenho assume aceleração por GPU; apenas em CPU, ele é notavelmente mais lento que um motor leve como o Piper, e pode não ser prático para uso em tempo real em hardware modesto, como um Raspberry Pi.
- Clonar uma voz a partir de áudio muito curto ou ruidoso. Embora 6 segundos seja o mínimo documentado, um clipe de referência ruidoso, comprimido ou com vários locutores produz um clone notavelmente pior do que uma gravação limpa de um único locutor.
- Um idioma fora dos 17 suportados. O XTTS v2 suporta exatamente inglês, espanhol, francês, alemão, italiano, português, polonês, turco, russo, holandês, tcheco, árabe, chinês (zh-cn), japonês, húngaro, coreano e hindi — não há roteiro oficial para idiomas adicionais até a publicação desta análise.
- Personificar alguém sem consentimento. Clonar a voz de uma pessoa real sem seu conhecimento ou consentimento levanta questões de consentimento, direito de imagem e potencialmente fraude ou personificação que são independentes da restrição não comercial da CPML — essas se aplicam independentemente dos termos de licença, tanto em uso pessoal quanto comercial.
Alternativas ao XTTS v2
Piper
- Melhor uso:
- Síntese apenas em CPU mais rápida, sem clonagem de voz, tempo real em um Raspberry Pi
- Licença:
- GPL-3.0-or-later
Kit de ferramentas Coqui TTS
- Melhor uso:
- O software que executa o XTTS v2 (e outros modelos) com uma base de código mais ampla e de licença permissiva
- Licença:
- MPL-2.0 (apenas o kit)
Bark
- Melhor uso:
- Áudio expressivo, não verbal — risadas, suspiros, som ambiente
- Licença:
- MIT
StyleTTS 2
- Melhor uso:
- Máxima qualidade de narração em inglês com som natural (sem clonagem de voz)
- Licença:
- MIT
ElevenLabs
- Melhor uso:
- API em nuvem gerenciada com clonagem de voz comercial e licenciamento comercial claro
- Licença:
- Proprietária (API em nuvem paga)
Perguntas frequentes
O que é o XTTS v2?
O XTTS v2 é um modelo de texto para fala com clonagem de voz multilíngue lançado pela Coqui, que clona uma voz a partir de apenas 6 segundos de áudio de referência e gera fala nessa voz em 17 idiomas, incluindo clonagem entre idiomas.
Posso usar o XTTS v2 comercialmente?
Não sem um acordo separado. O XTTS v2 é licenciado sob a Coqui Public Model License (CPML), que permite uso pessoal, de pesquisa e hobby, mas proíbe uso comercial — qualquer produto pago, SaaS, conteúdo com anúncios ou trabalho para clientes. A Coqui AI, a empresa que o lançou, encerrou seus serviços pagos em dezembro de 2023, e a PromptQuorum não conseguiu confirmar que existe hoje um caminho comercial ativo. Trate o XTTS v2 como exclusivamente não comercial.
Quanto áudio de referência o XTTS v2 precisa para clonar uma voz?
Apenas 6 segundos de áudio de referência limpo e de um único locutor, segundo sua ficha oficial no Hugging Face. Um clipe mais longo e limpo geralmente produz um clone mais preciso.
Quantos idiomas o XTTS v2 suporta?
Exatamente 17: inglês, espanhol, francês, alemão, italiano, português, polonês, turco, russo, holandês, tcheco, árabe, chinês (zh-cn), japonês, húngaro, coreano e hindi. Ele suporta clonagem entre idiomas — clone uma voz a partir de áudio em um desses idiomas e gere fala em qualquer um dos outros.
Como executo o XTTS v2?
Instale o kit de ferramentas Coqui TTS com pip install coqui-tts, depois carregue o modelo com TTS("tts_models/multilingual/multi-dataset/xtts_v2"). Defina primeiro a variável de ambiente COQUI_TOS_AGREED=1 se precisar aceitar a licença CPML de forma não interativa, como em um contêiner Docker ou pipeline de CI.
Preciso de uma GPU para executar o XTTS v2?
Uma GPU é fortemente recomendada. O XTTS v2 roda em CPU, mas de forma notavelmente mais lenta — sua latência de streaming documentada abaixo de 200ms assume aceleração por GPU, e o uso apenas em CPU não é prático para aplicações em tempo real.
Qual é a diferença entre o XTTS v2 e o kit de ferramentas Coqui TTS?
O XTTS v2 é um modelo específico de clonagem de voz, licenciado sob a CPML não comercial. O kit de ferramentas Coqui TTS é o software — um pacote Python e uma CLI — que executa o XTTS v2 e outros modelos, licenciado separadamente sob a MPL-2.0, que permite o uso comercial do código do kit em si.
Veredito
O XTTS v2 continua sendo um dos modelos de clonagem de voz local de maior qualidade disponíveis em 2026, e a combinação de um requisito de clonagem de 6 segundos, suporte a clonagem entre 17 idiomas e latência de streaming abaixo de 200ms é genuinamente capaz para uso pessoal, pesquisa e prototipagem. A decisão que realmente importa para a maioria dos leitores é a licença: a Coqui Public Model License é inequivocamente não comercial, e como a Coqui AI encerrou suas atividades em dezembro de 2023, não há hoje um caminho confirmado e ativo para uma licença comercial. Se o seu caso de uso é pessoal, acadêmico ou um protótipo não comercial, o XTTS v2 é uma escolha sólida e bem documentada. Se você precisa de clonagem de voz comercial, verifique os termos de licenciamento de forma independente antes de construir sobre ele, ou combine esta análise com a cobertura da PromptQuorum sobre Piper e Bark para alternativas com licença permissiva, ou a comparação com o ElevenLabs para uma opção comercial gerenciada.
Fontes
- XTTS v2 no Hugging Face — a ficha do modelo: idiomas, requisitos de clonagem e referência de licença.
- XTTS v2 LICENSE.txt — o texto completo da Coqui Public Model License (CPML) 1.0.0.
- idiap/coqui-ai-TTS no GitHub — o kit de ferramentas mantido ativamente que executa o XTTS v2, com documentação de uso.
- Análise do Coqui TTS — a análise dedicada da PromptQuorum sobre o kit de ferramentas, incluindo seu histórico de manutenção após o encerramento.
- Licenças de TTS local e clonagem de voz — comparação completa de licenças entre motores de TTS locais.
