Principais conclusões
- Descende do projeto de pesquisa TTS da Mozilla; desenvolvido pela startup Coqui AI, fundada em 2021 por ex-engenheiros da Mozilla TTS.
- A Coqui AI encerrou seus serviços de nuvem pagos em dezembro de 2023; o repositório original do GitHub coqui-ai/TTS não recebe novos commits desde agosto de 2024.
- Fork mantido ativamente: idiap/coqui-ai-TTS, pelo Instituto de Pesquisa Idiap, publicado no PyPI como
coqui-tts. - Licença: MPL-2.0 para o kit. O modelo XTTS v2 que ele pode executar está sob a CPML não comercial, separadamente — não confunda os dois.
- Gratuito, sem plano pago; roda em CPU, com GPU recomendada para modelos de clonagem de voz maiores.
- Última versão do pacote: coqui-tts v0.27.5, publicada em 26 de janeiro de 2026.
📍 Em uma frase
Coqui TTS é um kit de código aberto de síntese de voz e clonagem de voz local descendente do projeto TTS da Mozilla, cuja empresa original, Coqui AI, encerrou seus serviços pagos em dezembro de 2023, deixando o repositório original sem manutenção desde agosto de 2024 — mas um fork da comunidade mantido ativamente, idiap/coqui-ai-TTS, continua o desenvolvimento sob o Instituto de Pesquisa Idiap.
💬 Em termos simples
É um programa que você instala com pip install e que pode transformar texto em voz usando vários modelos de IA diferentes, incluindo um modelo de clonagem de voz chamado XTTS v2 — a empresa que o criou fechou, mas um instituto de pesquisa mantém o software atualizado hoje.
📌Nota: Instale coqui-tts (o fork mantido), não o nome de pacote original TTS do repositório coqui-ai/TTS agora sem manutenção, se você quer uma versão que recebe atualizações. Veja a seção Instalar e executar abaixo.
História: da Mozilla TTS a um fork comunitário
**O Coqui TTS remonta ao projeto TTS da Mozilla**, um esforço de pesquisa interno da Mozilla em tecnologia de voz de código aberto. Quando a Mozilla dissolveu esse grupo de pesquisa em 2021, vários de seus engenheiros — incluindo Eren Gölge, Kelly Davis, Josh Meyer e Reuben Morais — fundaram a startup Coqui AI para continuar o trabalho como uma empresa independente, lançando tanto um kit de texto para voz (Coqui TTS) quanto um kit de voz para texto (Coqui STT).
A Coqui AI levantou 3,3 milhões de dólares em uma rodada seed em março de 2023 e oferecia tanto um kit de código aberto quanto serviços de nuvem pagos, incluindo acesso hospedado ao seu modelo de clonagem de voz, XTTS. A empresa não conseguiu encontrar um modelo de negócio sustentável sobre software de código aberto, e anunciou o encerramento de seus serviços pagos em dezembro de 2023, com seus servidores saindo do ar em 11 de dezembro de 2023.
**O repositório original, coqui-ai/TTS, permanece publicamente disponível no GitHub** sob sua licença MPL-2.0, mas não recebe novos commits desde agosto de 2024, e o GitHub não o mostra como formalmente arquivado — na prática, ele não recebe desenvolvimento ativo nem correções de bugs.
**Um fork comunitário, idiap/coqui-ai-TTS, continua o desenvolvimento.** Ele é mantido pelo Instituto de Pesquisa Idiap, um instituto de pesquisa suíço, e publicado no PyPI sob o nome de pacote coqui-tts (distinto do nome de pacote original TTS). Seu README declara explicitamente que é um "fork do repositório original, sem manutenção", e seu histórico de versões mostra atualizações contínuas, incluindo uma versão v0.27.0 que adicionou um cache de clonagem de voz e uma versão v0.27.5 em 26 de janeiro de 2026.
Quem criou o Coqui TTS?
O Coqui TTS foi criado pela startup Coqui AI, fundada em 2021 por ex-engenheiros do projeto de pesquisa TTS da Mozilla, incluindo Eren Gölge, Kelly Davis, Josh Meyer e Reuben Morais. Após o encerramento dos serviços pagos da Coqui AI em dezembro de 2023, o desenvolvimento continuou em um fork comunitário mantido pelo Instituto de Pesquisa Idiap.
O que o Coqui TTS realmente faz
O Coqui TTS é um kit, não um único modelo — ele fornece uma interface Python unificada, uma CLI e um pipeline de treinamento para executar (e, historicamente, treinar) várias arquiteturas diferentes de modelos de texto para voz.
- Interface multi-modelo. Uma única classe Python
TTS()carrega e executa diferentes arquiteturas de modelo, incluindo modelos VITS de um ou vários falantes, modelos baseados em Tacotron2 e o modelo de clonagem de voz XTTS v2, sem alterar o código da aplicação ao redor. - Síntese via linha de comando. O comando CLI
ttssintetiza voz diretamente pelo terminal, listando todos os modelos pré-treinados disponíveis comtts --list_models. - Clonagem de voz via XTTS v2. Passar um argumento
speaker_wavpara um modelo XTTS v2 carregado clona uma voz a partir de um curto trecho de áudio de referência, gerando voz nessa voz clonada nos idiomas que o XTTS v2 suporta. - Ampla biblioteca de modelos pré-treinados. O kit dá acesso a modelos pré-treinados descritos como cobrindo mais de 1.100 idiomas via os modelos massivamente multilíngues baseados em Fairseq subjacentes, além de modelos curados de maior qualidade para idiomas específicos.
- Treinamento e ajuste fino de modelos. Além de executar modelos pré-treinados, o kit inclui scripts de treinamento e utilitários de análise de datasets para construir ou ajustar um modelo de voz personalizado — historicamente uma de suas funcionalidades mais usadas antes do encerramento do serviço de treinamento hospedado da Coqui AI.
- Inferência em streaming para o XTTS v2. O kit documenta síntese em streaming de baixa latência com o XTTS v2 (citada pela documentação do fork mantido como latência inferior a 200ms até o primeiro áudio), útil para aplicações de voz interativas.
Coqui TTS e XTTS v2: como se relacionam
Coqui TTS (o kit) e XTTS v2 (o modelo) são duas coisas diferentes com duas licenças diferentes, e confundi-los é um erro comum de licenciamento. O kit Coqui TTS — o pacote Python, a CLI e o código de treinamento — é licenciado sob MPL-2.0, uma licença permissiva que permite uso comercial com condições de divulgação de código sobre modificações no kit. O XTTS v2 é um modelo pré-treinado específico cujos pesos são distribuídos sob a Coqui Public Model License (CPML), uma licença não comercial, separada da licença MPL-2.0 do kit.
Na prática, isso significa que você pode usar o kit Coqui TTS comercialmente com modelos de licença permissiva (modelos VITS ou Tacotron2 treinados sob licenças compatíveis), enquanto a combinação específica de "kit Coqui TTS executando o modelo XTTS v2" herda a restrição não comercial do XTTS v2 para os pesos e saídas desse modelo. Executar um modelo diferente, de licença permissiva, através do mesmo kit não carrega essa restrição.
**O pacote coqui-tts documenta diretamente o uso do XTTS v2**, com o modelo carregado como TTS("tts_models/multilingual/multi-dataset/xtts_v2"), já que o kit é a forma principal suportada de executar o XTTS v2 fora de usar diretamente os pesos do modelo através de outra pilha de inferência. Veja a análise dedicada do XTTS v2 do PromptQuorum para uma análise completa da licença e das capacidades desse modelo.
Instalar e executar o Coqui TTS: passo a passo
Este guia instala o pacote coqui-tts mantido ativamente e executa uma primeira síntese, usando a sintaxe documentada no próprio README do fork mantido.
- 1Instale o pacote mantido.
Why it matters: Execute `pip install coqui-tts` (ou `uv pip install coqui-tts` se usar uv) em um ambiente Python. Instale especificamente o pacote `coqui-tts` — não o nome de pacote mais antigo `TTS`, que aponta para o repositório original agora sem manutenção. - 2Liste os modelos pré-treinados disponíveis.
Why it matters: Execute `tts --list_models` para ver o catálogo completo de modelos pré-treinados disponíveis para download, organizados por idioma e arquitetura (VITS, Tacotron2, XTTS e outros). - 3Sintetize voz pela linha de comando.
Why it matters: Execute `tts --text "Hello world" --out_path output.wav` para sintetizar com o modelo padrão, ou adicione `--model_name <modelo>` para escolher um específico da lista. - 4(Opcional) Use a API Python para clonagem de voz com o XTTS v2.
Why it matters: Carregue o modelo com `TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)`, depois chame `.tts_to_file()` com um argumento `speaker_wav` apontando para um curto trecho de áudio de referência e um argumento `language` para clonar uma voz. - 5(Opcional) Ative a aceleração por GPU.
Why it matters: Passe `gpu=True` ao construtor `TTS()`, ou chame `.to("cuda")` no objeto de modelo carregado, para executar a inferência em uma GPU NVIDIA — recomendado para o XTTS v2, que é significativamente mais lento apenas com CPU. - 6(Opcional) Aceite a licença CPML de forma não interativa para o XTTS v2.
Why it matters: Carregar o XTTS v2 pela primeira vez solicita uma etapa interativa de aceitação da CPML. Defina a variável de ambiente `COQUI_TOS_AGREED=1` para aceitá-la de forma não interativa, necessária para uso não supervisionado em containers Docker ou pipelines de CI.
Exemplos reais de uso
Além do guia básico de instalação acima, estes são padrões comuns de uso real da própria documentação do fork mantido.
- Aceitação não interativa da CPML para ambientes automatizados: defina
COQUI_TOS_AGREED=1antes do primeiro carregamento do XTTS v2, para que builds do Docker e pipelines de CI não fiquem travados em um prompt interativo. - Introspecção de falantes e idiomas: após carregar um modelo multi-falante ou multilíngue,
tts.speakersetts.languageslistam o que o modelo carregado realmente suporta — útil para validar a entrada antes da síntese.
# Linha de comando: listar modelos pré-treinados disponíveis
tts --list_models
# Linha de comando: sintetizar com o modelo padrão
tts --text "Hello world" --out_path output.wav
# Linha de comando: sintetizar com um modelo específico
tts --model_name "tts_models/en/ljspeech/tacotron2-DDC" \
--text "This is a test." --out_path output.wav
# API Python: síntese básica
from TTS.api import TTS
tts = TTS("tts_models/en/ljspeech/tacotron2-DDC")
tts.tts_to_file(text="Hello world", file_path="output.wav")
# API Python: clonagem de voz com XTTS v2 (aceite a CPML de forma não interativa primeiro)
# export COQUI_TOS_AGREED=1
import torch
from TTS.api import TTS
device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)
tts.tts_to_file(
text="Hola, esto es una prueba.",
speaker_wav="reference_voice.wav",
language="es",
file_path="cloned_output.wav",
)
# API Python: listar falantes e idiomas disponíveis em um modelo carregado
print(tts.speakers)
print(tts.languages)Licença e custo
O kit Coqui TTS é licenciado sob MPL-2.0 (Mozilla Public License 2.0), confirmado pelos metadados publicados do pacote coqui-tts no PyPI e pelo arquivo de licença no repositório idiap/coqui-ai-TTS. A MPL-2.0 é uma licença permissiva com condições: você pode usar o kit comercialmente, mas se modificar e distribuir os próprios arquivos-fonte do kit, deve publicar esses arquivos modificados específicos também sob a MPL-2.0. Usar o kit como dependência não modificada não coloca o código da sua própria aplicação sob a MPL-2.0.
O modelo XTTS v2 é licenciado separadamente, sob a Coqui Public Model License (CPML), que é não comercial — isso se aplica aos pesos do modelo e suas saídas de áudio geradas, não ao código do kit Coqui TTS que os executa. Veja a análise do XTTS v2 do PromptQuorum para a análise completa dessa licença.
Não há plano pago, assinatura ou taxa de licença para o kit Coqui TTS em si. Os serviços hospedados pagos da Coqui AI encerraram em dezembro de 2023 e não estão disponíveis a nenhum preço; a única forma de usar o Coqui TTS hoje é auto-hospedado, usando o pacote original sem manutenção ou o fork coqui-tts mantido ativamente.
Que licença o Coqui TTS usa?
O kit Coqui TTS em si é licenciado sob MPL-2.0, que permite uso comercial com a condição de que modificações nos próprios arquivos-fonte do kit sejam publicadas sob a mesma licença. Isso é separado da licença de qualquer modelo específico que ele execute — o modelo XTTS v2, por exemplo, está sob a Coqui Public Model License (CPML) não comercial, que se aplica aos pesos e saídas do modelo, não ao código do kit.
Para que o Coqui TTS não é bom
O Coqui TTS é um kit flexível multi-modelo, não a opção mais rápida ou mais simples para todo caso de uso. É a ferramenta errada para as seguintes situações:
- Construir sobre o repositório original sem manutenção. Se você executar
pip install TTS(o nome de pacote original) em vez depip install coqui-tts(o fork mantido), está construindo sobre código que não recebe atualizações desde agosto de 2024 — verifique a qual pacote um tutorial ou dependência realmente se refere antes de confiar nele. - A síntese somente-CPU mais rápida possível. Se sua prioridade é voz em tempo real em hardware modesto como um Raspberry Pi sem GPU, o Piper é construído especificamente para isso e mais simples de implantar; os modelos maiores do Coqui TTS, especialmente o XTTS v2, são notavelmente mais lentos apenas com CPU.
- Clonagem de voz comercial sem uma verificação de licença separada. Executar o XTTS v2 através do kit Coqui TTS ainda carrega a própria restrição não comercial do XTTS v2 (CPML) sobre os pesos e saídas do modelo — a licença MPL-2.0 do kit não sobrepõe isso. Veja a seção Licença e custo acima.
- Suporte corporativo garantido a longo prazo. A empresa Coqui AI não existe mais desde dezembro de 2023. O fork atual é mantido por um instituto de pesquisa em base comunitária, um modelo de manutenção diferente de uma empresa financiada com contrato de suporte — considere isso para decisões sobre infraestrutura de produção crítica.
- Uma API única e estável entre versões. Como o desenvolvimento se moveu entre um original sem manutenção e um fork ativamente desenvolvido, alguns tutoriais, respostas do Stack Overflow e posts de blog online referenciam uma superfície de API mais antiga ou o nome de pacote original — verifique com a documentação atual do
coqui-ttsem vez de um resultado de busca mais antigo.
Alternativas ao Coqui TTS
Piper
- Melhor para:
- A síntese somente-CPU mais rápida, sem clonagem de voz, tempo real em uma Raspberry Pi
- Licença:
- GPL-3.0-or-later
XTTS v2
- Melhor para:
- O próprio modelo de clonagem de voz, se você só precisa do XTTS v2 e não do kit mais amplo
- Licença:
- CPML (não comercial)
Bark
- Melhor para:
- Áudio não vocal expressivo — risadas, suspiros, sons ambientes
- Licença:
- MIT
StyleTTS 2
- Melhor para:
- A melhor qualidade de narração natural em inglês (sem clonagem de voz)
- Licença:
- MIT
ElevenLabs
- Melhor para:
- API de nuvem gerenciada para equipes que preferem não se auto-hospedar, com clonagem de voz comercial
- Licença:
- Proprietária (API de nuvem paga)
Perguntas frequentes
O que é o Coqui TTS?
Coqui TTS é um kit de código aberto de síntese de voz e clonagem de voz local descendente do projeto de pesquisa TTS da Mozilla, criado originalmente pela startup Coqui AI. Ele suporta várias arquiteturas de modelo, incluindo o modelo de clonagem de voz XTTS v2, através de uma única interface Python e CLI.
O Coqui TTS ainda é mantido?
O repositório original coqui-ai/TTS não é mais mantido ativamente — não recebe novos commits desde agosto de 2024, após a empresa Coqui AI encerrar seus serviços pagos em dezembro de 2023. Um fork da comunidade mantido ativamente, idiap/coqui-ai-TTS, continua o desenvolvimento sob o Instituto de Pesquisa Idiap e é publicado no PyPI como o pacote coqui-tts, com versões tão recentes quanto janeiro de 2026.
O Coqui TTS é gratuito?
Sim, o kit em si não tem plano pago nem taxa de licença. Os antigos serviços hospedados pagos da Coqui AI encerraram em dezembro de 2023 e não estão disponíveis a nenhum preço. Alguns modelos específicos que rodam sobre o kit, como o XTTS v2, têm sua própria licença separada (CPML) que restringe o uso comercial dos pesos e saídas desse modelo.
Qual é a diferença entre os pacotes coqui-tts e TTS?
TTS é o nome de pacote original do PyPI, ligado ao repositório coqui-ai/TTS sem manutenção e sem atualizações desde agosto de 2024. coqui-tts é o nome de pacote do fork mantido ativamente, publicado a partir do repositório idiap/coqui-ai-TTS sob o Instituto de Pesquisa Idiap, com versões regulares incluindo a v0.27.5 em janeiro de 2026. Instale coqui-tts para uma versão que recebe atualizações.
O Coqui TTS suporta clonagem de voz?
Sim, através do modelo XTTS v2, que o kit pode carregar e executar. O XTTS v2 clona uma voz a partir de um curto trecho de áudio de referência passado como argumento speaker_wav. Observe que a própria licença do XTTS v2, a Coqui Public Model License (CPML), é não comercial, separada da licença MPL-2.0 do kit.
Por que a Coqui AI fechou?
A Coqui AI, a empresa por trás do Coqui TTS, anunciou o encerramento de seus serviços hospedados pagos em dezembro de 2023, com seus servidores saindo do ar em 11 de dezembro de 2023, após lutar para construir um modelo de negócio sustentável sobre tecnologia de voz de código aberto. O kit de código aberto em si continuou disponível, e o desenvolvimento continuou depois em um fork comunitário.
Qual é a última versão do Coqui TTS?
A última versão do pacote coqui-tts mantido ativamente é v0.27.5, publicada em 26 de janeiro de 2026, segundo seu registro no PyPI.
Veredito
O Coqui TTS é um estudo de caso genuinamente útil sobre o que acontece com uma infraestrutura de código aberto após o fechamento da empresa por trás dela: o repositório original ficou silencioso em agosto de 2024, mas o software não desapareceu — um instituto de pesquisa assumiu a manutenção, renomeou o pacote e continuou lançando versões até 2026. Para quem o avalia hoje, a conclusão prática é simples: instale coqui-tts, não o pacote TTS original, e entenda que a licença MPL-2.0 do kit é separada da licença não comercial CPML do modelo XTTS v2 que ele pode executar. Como kit, sua força está na flexibilidade entre arquiteturas de modelo, em vez de ser a opção mais rápida ou mais simples para qualquer caso de uso específico — para isso, combine esta análise com a cobertura do PromptQuorum sobre o Piper para velocidade, o XTTS v2 especificamente para o modelo de clonagem, ou o guia de licenças de TTS local para o panorama completo entre motores.
Fontes
- idiap/coqui-ai-TTS no GitHub — o fork mantido ativamente: README, documentação, licença e histórico de versões.
- coqui-tts no PyPI — metadados publicados do pacote, incluindo a licença MPL-2.0 atual e o histórico de versões.
- coqui-ai/TTS no GitHub — o repositório original, agora sem manutenção (licença MPL-2.0).
- XTTS v2 no Hugging Face — a ficha do modelo e o texto da licença CPML do modelo de clonagem de voz.
- Instituto de Pesquisa Idiap — o instituto de pesquisa suíço que mantém o fork comunitário.
