Skip to main content
PromptQuorum
Início/LLMs locais avançados/StyleTTS 2 análise (2026): o modelo de pesquisa da Columbia com licença MIT para voz natural
Voice, Speech & Multimodal

StyleTTS 2 análise (2026): o modelo de pesquisa da Columbia com licença MIT para voz natural

·12 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

O StyleTTS 2 é um modelo de texto para voz de código aberto e nível de pesquisa da Universidade Columbia, que gera fala com som natural usando difusão de estilo e treinamento adversarial com grandes modelos de linguagem de voz. Seu código está sob licença MIT, instalado com git clone https://github.com/yl4579/StyleTTS2.git && pip install -r requirements.txt. Seu README adiciona uma condição separada, fora da licença, sobre os pesos do modelo pré-treinado (divulgar que a fala é sintetizada, a menos que você tenha permissão do locutor), e o repositório público do GitHub não mostra commits desde 7 de março de 2024. Para uma comparação completa de licenças entre motores TTS locais, consulte o guia de licenças de TTS local da PromptQuorum.

O StyleTTS 2 é um modelo de texto para voz de código aberto lançado por pesquisadores da Universidade Columbia, distribuído no GitHub, que gera fala com som natural usando difusão de estilo e treinamento adversarial com grandes modelos de linguagem de voz. Seu código está sob licença MIT, mas seu README adiciona uma condição de divulgação separada, fora da licença, para os pesos do modelo pré-treinado, e o repositório público não tem commits desde 7 de março de 2024. Esta análise cobre o que o StyleTTS 2 realmente faz, comandos reais de instalação e inferência, a nuance de licenciamento entre o código MIT e os pesos condicionais, e seu status de manutenção adormecido mas não arquivado — o panorama honesto para quem o avalia em 2026.

StyleTTS 2 análise (2026): o modelo de pesquisa da Columbia com licença MIT para voz natural

Principais conclusões

  • Fala com som natural via difusão de estilo e treinamento adversarial, igualando ou superando gravações humanas em benchmarks padrão de locutor único segundo seu artigo do NeurIPS.
  • Licença do código: MIT. Os pesos do modelo pré-treinado carregam uma condição de divulgação separada no README, não codificada no texto da licença MIT.
  • Transferência de estilo zero-shot a partir de um clipe de referência de 5 a 10 segundos via o checkpoint multi-locutor do LibriTTS (15 a 30 segundos recomendados).
  • A inferência oficial precisa do espeak-ng, licenciado sob GPL-3.0; um pacote pip comunitário evita isso, mas seu último lançamento é de 11 de janeiro de 2024.
  • Nenhum commit no repositório oficial desde 7 de março de 2024; não arquivado, mais de 6.300 estrelas no GitHub.
  • Os checkpoints pré-treinados são principalmente em inglês; o alinhador de texto também foi treinado com corpora japonês e chinês e generaliza razoavelmente para outros idiomas sem ajuste fino.

📍 Em uma frase

O StyleTTS 2 é o modelo de texto para voz de pesquisa com licença MIT da Universidade Columbia, que produz fala com som natural via difusão de estilo e treinamento adversarial, com uma condição de divulgação em nível de documentação sobre seus pesos pré-treinados e sem commits no GitHub desde 7 de março de 2024.

💬 Em termos simples

É um modelo de IA gratuito e baixável que transforma texto em fala com som muito natural, criado por pesquisadores universitários em vez de uma empresa — livre para uso comercial segundo a licença do código, mas suas próprias instruções pedem para você informar aos ouvintes que a fala é sintetizada, e ninguém parece estar corrigindo erros ativamente nele mais.

📌Nota: Uma issue do GitHub sobre o projeto (#37) apontou que o requisito de divulgação do README para modelos pré-treinados fica fora do próprio arquivo de licença MIT, o que alguns leitores consideram confuso. Leia o arquivo LICENSE e a seção de uso do modelo do README você mesmo antes de implantar — veja a seção Licença e custo abaixo.

História: um projeto de pesquisa da Columbia

O StyleTTS 2 foi criado por pesquisadores do Departamento de Engenharia Elétrica da Universidade Columbia — Yinghao Aaron Li, Cong Han, Vinay S. Raghavan, Gavin Mischler e Nima Mesgarani — e publicado como um artigo do NeurIPS 2023 intitulado "StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models".

A alegação central do artigo é que sua combinação de difusão de estilo (modelar o estilo de fala como uma distribuição de probabilidade latente em vez de um único vetor fixo) e treinamento adversarial contra grandes modelos de linguagem de voz pré-treinados permite modelar a variação de fala humana com mais precisão do que abordagens anteriores. No benchmark de locutor único LJSpeech, o artigo relata que o StyleTTS 2 iguala ou supera gravações de fala humana real em avaliações de ouvintes; no conjunto de dados multi-locutor LibriTTS, relata superar modelos públicos disponíveis anteriormente na adaptação zero-shot ao locutor.

O repositório público do GitHub yl4579/StyleTTS2 acumulou mais de 6.300 estrelas, e não está marcado como arquivado — mas a PromptQuorum não encontrou commits na branch principal do repositório desde 7 de março de 2024, com base no histórico público de commits do projeto. Isso é consistente com um lançamento de pesquisa universitária, e não com um produto de código aberto mantido comercialmente: o código, o artigo e os checkpoints pré-treinados foram publicados para acompanhar a pesquisa, sem compromisso contínuo com desenvolvimento de recursos ou lançamentos de correção de bugs.

Um pacote pip mantido pela comunidade, styletts2, do desenvolvedor Sidharth Rajaram, envolve o código de pesquisa original em um pacote instalável (pip install styletts2) que substitui o fonemizador espeak-ng, licenciado sob GPL-3.0, pela biblioteca gruut, licenciada sob MIT, para manter toda a cadeia de instalação sob licença permissiva. Seu lançamento mais recente no PyPI é a versão 0.1.6, publicada em 11 de janeiro de 2024 — também com mais de dois anos e meio no momento desta análise, e um projeto de terceiros separado do código de pesquisa original da Columbia.

Quem criou o StyleTTS 2?

O StyleTTS 2 foi criado por Yinghao Aaron Li, Cong Han, Vinay S. Raghavan, Gavin Mischler e Nima Mesgarani, pesquisadores do Departamento de Engenharia Elétrica da Universidade Columbia, e publicado como um artigo do NeurIPS 2023.

O que o StyleTTS 2 realmente faz

O StyleTTS 2 é um modelo de texto para voz que gera um espectrograma mel (e, em sua configuração ponta a ponta, uma forma de onda bruta) a partir do texto de entrada, usando um modelo de difusão para amostrar um vetor de "estilo" latente em vez de exigir que seja previsto de forma determinística — esse mecanismo é creditado pelo artigo como produtor de uma prosódia mais natural e humana.

  • Difusão de estilo para prosódia natural. Em vez de prever um único embedding de estilo fixo a partir do texto, o StyleTTS 2 amostra, via difusão, uma distribuição de probabilidade aprendida sobre estilos, o que, segundo o artigo, produz variação mais natural em tom, ritmo e ênfase do que abordagens determinísticas.
  • Treinamento adversarial contra modelos de linguagem de voz. O processo de treinamento coloca o modelo TTS contra grandes modelos de linguagem de voz (SLMs) pré-treinados atuando como discriminadores, uma técnica que o artigo credita por fechar a lacuna restante em relação à qualidade de gravação humana no benchmark LJSpeech.
  • Dois checkpoints pré-treinados oficialmente lançados. StyleTTS2-LJSpeech (locutor único em inglês, 24kHz) e StyleTTS2-LibriTTS (multi-locutor em inglês) estão ambos hospedados no Hugging Face.
  • Transferência de estilo zero-shot a partir de áudio de referência. O checkpoint multi-locutor do LibriTTS pode sintetizar novo texto em um estilo capturado a partir de um clipe de áudio de referência — a documentação do próprio projeto e guias de terceiros descrevem um mínimo de 5 a 10 segundos, com 15 a 30 segundos de áudio de referência limpo, de locutor único, recomendados para timbre, prosódia e pronúncia precisos.
  • Checkpoints pré-treinados principalmente em inglês, com algum trabalho de base multilíngue. Os checkpoints oficialmente lançados são treinados em conjuntos de dados em inglês (LJSpeech, LibriTTS). O artigo observa que seu componente alinhador de texto também foi pré-treinado em corpora japonês (JVS) e chinês (AiShell) e "funciona bem para a maioria dos outros idiomas sem ajuste fino", e faz referência a um modelo PL-BERT multilíngue cobrindo 14 idiomas como ponto de partida para treinar você mesmo um modelo StyleTTS 2 não inglês — mas não há um checkpoint não inglês oficialmente lançado e pronto para uso.

Instalar e executar o StyleTTS 2: passo a passo

Este passo a passo segue a configuração documentada pelo próprio projeto para executar inferência com um checkpoint pré-treinado.

  1. 1
    Clonar o repositório e instalar as dependências.
    Why it matters: Execute `git clone https://github.com/yl4579/StyleTTS2.git && cd StyleTTS2 && pip install -r requirements.txt`. Isso instala as dependências principais do Python listadas no próprio arquivo de requisitos do projeto.
  2. 2
    Instalar o fonemizador e o espeak-ng.
    Why it matters: Execute `pip install phonemizer` e, no Linux, `sudo apt-get install espeak-ng` (ou o equivalente para seu sistema operacional). Observe que o espeak-ng em si é licenciado sob GPL-3.0 — veja a seção Licença e custo para entender por que isso importa para o caminho de inferência, não apenas para o código do StyleTTS 2 em si.
  3. 3
    Baixar um checkpoint pré-treinado.
    Why it matters: Baixe [StyleTTS2-LJSpeech](https://huggingface.co/yl4579/StyleTTS2-LJSpeech/tree/main) (locutor único) ou [StyleTTS2-LibriTTS](https://huggingface.co/yl4579/StyleTTS2-LibriTTS/tree/main) (multi-locutor, suporta transferência de estilo) do Hugging Face para o diretório do projeto.
  4. 4
    Executar inferência via os notebooks fornecidos.
    Why it matters: O projeto vem com `Demo/Inference_LJSpeech.ipynb` e `Demo/Inference_LibriTTS.ipynb` — abra o que corresponde ao seu checkpoint baixado no Jupyter para carregar o modelo e sintetizar sua primeira amostra.
  5. 5
    (Alternativa) Usar o pacote pip comunitário para uma cadeia de instalação mais simples, somente MIT.
    Why it matters: Execute `pip install styletts2`, depois `from styletts2 import tts; my_tts = tts.StyleTTS2(); my_tts.inference("Olá.", output_wav_file="test.wav")`. Este pacote de terceiros (último lançamento em 11 de janeiro de 2024) usa a biblioteca gruut, licenciada sob MIT, em vez do espeak-ng, evitando a dependência GPL-3.0 — ao custo de depender de um wrapper não oficial que também está adormecido.
  6. 6
    (Opcional) Fornecer um clipe de referência para transferência de estilo.
    Why it matters: Com o checkpoint do LibriTTS, passe um argumento `target_voice_path` (pacote comunitário) ou o parâmetro de áudio de referência equivalente (notebook oficial) apontando para um arquivo WAV limpo de locutor único de 15 a 30 segundos, para sintetizar novo texto naquele estilo capturado.

Exemplos de uso reais

Estes exemplos mostram tanto a API simplificada do pacote pip comunitário quanto o padrão usado nos notebooks de inferência do projeto oficial.

  • A qualidade do áudio de referência importa para a transferência de estilo. Um clipe limpo, de locutor único, de 15 a 30 segundos produz uma transferência de estilo notavelmente melhor do que uma referência curta, ruidosa ou multi-locutor.
  • Existem duas cadeias de dependências separadas. O caminho por notebook do repositório oficial traz o espeak-ng, licenciado sob GPL-3.0; o pacote pip comunitário evita isso usando o gruut — escolha a cadeia que corresponde aos seus requisitos de licenciamento antes de construir ferramentas em torno de qualquer uma delas.
python
# Caminho mais simples: pacote pip comunitário (cadeia de dependências somente MIT,
# último lançamento em 2024-01-11 — verifique se ainda funciona antes de depender dele)
pip install styletts2

from styletts2 import tts

my_tts = tts.StyleTTS2()
my_tts.inference(
    "Hello there, this is a natural-sounding synthesized sentence.",
    output_wav_file="test.wav",
)

# Transferência de estilo zero-shot a partir de um clipe de referência (checkpoint tipo LibriTTS)
my_tts.inference(
    "The same text, now spoken in a captured reference style.",
    target_voice_path="reference_voice.wav",
    output_wav_file="styled_test.wav",
)

# Caminho de checkpoint e configuração personalizados
custom_tts = tts.StyleTTS2(
    model_checkpoint_path="/path/to/epochs_2nd_00020.pth",
    config_path="/path/to/config.yml",
)

# --- Caminho do repositório oficial (requer espeak-ng, GPL-3.0) ---
# git clone https://github.com/yl4579/StyleTTS2.git
# cd StyleTTS2 && pip install -r requirements.txt
# pip install phonemizer && sudo apt-get install espeak-ng
# Depois abra Demo/Inference_LJSpeech.ipynb ou Demo/Inference_LibriTTS.ipynb
# no Jupyter e execute as células fornecidas com seu checkpoint baixado.

Licença e custo

O código do StyleTTS 2 é licenciado sob a licença MIT, confirmado pelo arquivo LICENSE no repositório oficial. MIT é uma licença permissiva: você pode usar, modificar e redistribuir o código, inclusive comercialmente, com restrições mínimas.

Os pesos do modelo pré-treinado carregam uma condição separada, fora da licença, declarada no README, não no arquivo LICENSE em si. O README do projeto pede aos usuários que "informem aos ouvintes que as amostras de fala são sintetizadas pelos modelos StyleTTS 2, a menos que você tenha permissão para usar a voz que sintetiza". Isso é um pedido em nível de documentação, não uma cláusula de licença formal — uma issue do GitHub sobre o projeto (#37) sinalizou explicitamente isso como potencialmente confuso, já que o selo de licença e o arquivo LICENSE do repositório sugerem, a um leitor que não lê também a seção de uso do modelo do README, que apenas os termos MIT se aplicam. A PromptQuorum não encontrou resposta dos mantenedores resolvendo essa ambiguidade no tópico público da issue. Trate a condição de divulgação como um pedido real e documentado dos autores, e cumpra-a — mas entenda que ela fica fora da concessão MIT formal sobre o código em si, uma estrutura genuinamente incomum que vale a pena observar antes do uso comercial.

Executar a inferência oficial traz uma dependência licenciada sob GPL-3.0: o espeak-ng. As próprias instruções de instalação do projeto pedem pip install phonemizer mais uma instalação em nível de sistema do espeak-ng, e o espeak-ng é licenciado sob GPL-3.0. GPL-3.0 é uma licença copyleft com obrigações de distribuição distintas da MIT; usar o espeak-ng como uma dependência de sistema externa não modificada geralmente é tratado de forma diferente de vincular estaticamente ou redistribuir seu código-fonte modificado, mas o limite exato depende da sua implantação. O pacote pip comunitário styletts2 contorna esse problema específico usando a biblioteca gruut, licenciada sob MIT, em vez do espeak-ng — uma diferença prática real se você quiser uma cadeia de dependências totalmente permissiva, ao custo de depender de um pacote de terceiros com uma data de último lançamento (11 de janeiro de 2024) ainda mais antiga do que a do repositório oficial.

Nada disso é aconselhamento jurídico. Leia o arquivo LICENSE, a seção de uso do modelo do README, e consulte um advogado para sua implantação específica antes de lançar o StyleTTS 2 em um produto comercial.

Qual licença o StyleTTS 2 usa?

O código do StyleTTS 2 é licenciado sob MIT. Seus pesos de modelo pré-treinado carregam uma condição separada, fora da licença, declarada no README do projeto (divulgar fala sintetizada, a menos que você tenha permissão do locutor), que não faz parte do texto formal da licença MIT — uma distinção que uma issue do GitHub sobre o projeto sinalizou como potencialmente confusa. Isso não é aconselhamento jurídico; leia o arquivo LICENSE e o README você mesmo antes do uso comercial.

Para que o StyleTTS 2 não é bom

O StyleTTS 2 é um modelo de nível de pesquisa com qualidade de saída genuinamente forte, não um produto de consumo polido e ativamente mantido. É a ferramenta errada para as seguintes situações:

  • Leitores que querem uma experiência simples de instalar com pip e pronto. Ao contrário do Piper, que está a pip install piper-tts e um único comando CLI de distância de ter áudio funcionando, o caminho oficial do StyleTTS 2 envolve clonar um repositório de pesquisa, instalar um fonemizador, uma dependência de sistema do espeak-ng e executar notebooks Jupyter — uma barreira de configuração notavelmente mais alta.
  • Implantação em produção sem esforço de engenharia de ML. Não há um modo de servidor web mantido, nenhuma imagem Docker oficial, e nenhuma empresa apoiando suporte contínuo. Qualquer um que implante o StyleTTS 2 em produção deve esperar escrever e manter sua própria camada de serviço em torno do código de pesquisa.
  • Correções de bugs ou atualizações de recursos contínuas garantidas. Sem commits no repositório oficial desde 7 de março de 2024, e com o último lançamento do pacote pip comunitário datado de 11 de janeiro de 2024, não assuma manutenção ativa para nenhuma das duas cadeias de dependências — planeje-se para a possibilidade de estar por conta própria em qualquer problema que encontrar.
  • Fala pronta para uso em outro idioma que não o inglês. Os checkpoints pré-treinados oficialmente lançados são apenas em inglês (LJSpeech, LibriTTS). Treinar você mesmo um modelo não inglês é arquiteturalmente possível segundo as notas do artigo sobre seu alinhador de texto multilíngue e o PL-BERT, mas exige seu próprio treinamento — não há checkpoint não inglês baixável do projeto.
  • Uma única concessão de licença inequívoca para tudo o que você baixa. Como o código (MIT) e os pesos pré-treinados (MIT mais uma condição de divulgação no README) são regidos de forma ligeiramente diferente, e o caminho de inferência oficial traz uma dependência GPL-3.0, o StyleTTS 2 não oferece a história de licença única e simples que um projeto como o Bark (totalmente MIT, sem condições extras) tem.

Alternativas ao StyleTTS 2

Piper

Melhor para:
Configuração simples pip-install-e-pronto, síntese CPU mais rápida, tempo real em Raspberry Pi
Licença:
GPL-3.0-or-later

XTTS v2

Melhor para:
Clonagem de voz empacotada a partir de 6 segundos de áudio de referência, 17 idiomas
Licença:
CPML (não comercial)

Coqui TTS

Melhor para:
Kit multi-backend flexível com amplo suporte de idiomas e fork mantido
Licença:
MPL-2.0

Bark

Melhor para:
Áudio expressivo não vocal — risadas, suspiros, som ambiente, licença MIT única e inequívoca
Licença:
MIT

ElevenLabs

Melhor para:
API em nuvem gerenciada com clonagem de voz comercial e suporte ativo, sem esforço de auto-hospedagem
Licença:
Proprietária (API em nuvem paga)

Perguntas frequentes

O que é o StyleTTS 2?

O StyleTTS 2 é um modelo de texto para voz de código aberto de pesquisadores da Universidade Columbia, que gera fala com som natural via difusão de estilo e treinamento adversarial com grandes modelos de linguagem de voz, publicado como um artigo do NeurIPS 2023.

O StyleTTS 2 é gratuito para uso comercial?

Seu código é licenciado sob MIT, que permite uso comercial. Seus pesos de modelo pré-treinado carregam uma condição separada, fora da licença, no README, pedindo para divulgar a fala sintetizada, a menos que você tenha permissão do locutor. Isso não é aconselhamento jurídico; leia o arquivo LICENSE e o README você mesmo antes de uma implantação comercial.

O StyleTTS 2 pode clonar uma voz?

Seu checkpoint multi-locutor do LibriTTS suporta transferência de estilo zero-shot a partir de um clipe de áudio de referência (5 a 10 segundos no mínimo, 15 a 30 segundos recomendados), o que se assemelha à clonagem de voz em espírito. Não é empacotado como um recurso de clonagem simples de uma linha como o XTTS v2 — usá-lo requer o fluxo de trabalho oficial baseado em notebook ou o pacote pip comunitário.

O StyleTTS 2 ainda é mantido?

O repositório oficial do GitHub não está marcado como arquivado, mas a PromptQuorum não encontrou commits desde 7 de março de 2024. O pacote pip comunitário que simplifica a instalação foi lançado pela última vez em 11 de janeiro de 2024. Trate ambos como artefatos de pesquisa adormecidos, e não como software em desenvolvimento ativo.

O StyleTTS 2 suporta idiomas além do inglês?

Os checkpoints pré-treinados oficialmente lançados (LJSpeech, LibriTTS) são apenas em inglês. O artigo observa que seu componente alinhador de texto também foi treinado com corpora japonês e chinês e generaliza razoavelmente para outros idiomas sem ajuste fino, e faz referência a um modelo PL-BERT multilíngue de 14 idiomas como ponto de partida para treinar seu próprio modelo não inglês — mas não há checkpoint não inglês pronto para uso oficialmente lançado.

Por que a instalação oficial do StyleTTS 2 precisa do espeak-ng, e por que isso importa?

O caminho de inferência oficial usa a biblioteca phonemizer com o espeak-ng como backend para converter texto em fonemas. O espeak-ng é licenciado sob GPL-3.0, uma licença copyleft com obrigações de distribuição diferentes da MIT. Um pacote pip comunitário (styletts2) evita isso usando a biblioteca gruut, licenciada sob MIT, em vez disso, ao custo de depender de um lançamento não oficial ainda mais antigo (última atualização em 11 de janeiro de 2024).

Como o StyleTTS 2 se compara ao XTTS v2?

O código do StyleTTS 2 é licenciado sob MIT e livre para uso comercial (com a condição de divulgação do README sobre os pesos); o XTTS v2 é licenciado sob a Coqui Public Model License, não comercial. A configuração oficial do StyleTTS 2 é mais de nível de pesquisa e exige mais trabalho manual; o XTTS v2 oferece uma API de clonagem de voz mais simples e empacotada através do kit Coqui TTS. Escolha com base em suas necessidades de licenciamento e tolerância à complexidade de configuração.

Veredito

O StyleTTS 2 continua genuinamente impressionante em qualidade de saída: sua abordagem de difusão de estilo e treinamento adversarial é creditada em seu próprio artigo do NeurIPS por igualar ou superar a qualidade de gravação humana no benchmark LJSpeech, sob uma licença de código (MIT) tão permissiva quanto possível. O que o impede de ser uma recomendação fácil para a maioria dos leitores é tudo o que envolve esse modelo central: uma condição de divulgação em nível de documentação sobre os pesos pré-treinados que fica fora da concessão MIT formal, um caminho de inferência oficial que traz uma dependência GPL-3.0, um pacote pip comunitário que evita essa dependência mas que em si tem mais de dois anos e meio de idade, e nenhum commit no repositório oficial desde 7 de março de 2024. Se você quer a melhor qualidade de narração em inglês natural disponível localmente e está confortável com uma configuração de nível de pesquisa e uma cadeia de dependências não mantida, o StyleTTS 2 entrega. Se você quer uma instalação mais simples, manutenção ativa, ou clonagem de voz empacotada, combine esta análise com a cobertura da PromptQuorum sobre o Piper para síntese CPU rápida, o XTTS v2 para clonagem de voz empacotada, ou a comparação com o ElevenLabs para uma alternativa totalmente gerenciada. Esta análise é a última de seis motores locais de reconhecimento e síntese de fala que a PromptQuorum analisou em profundidade, ao lado do Whisper.cpp, Faster Whisper, Piper, Coqui TTS, XTTS v2 e Bark.

Fontes

← Voltar para LLMs locais avançados