핵심 요점
- NeurIPS 논문에 따르면 스타일 확산과 적대적 학습을 통해 자연스러운 음성을 생성하며, 표준 단일 화자 벤치마크에서 인간 녹음과 동등하거나 이를 능가함.
- 코드 라이선스: MIT. 사전 학습된 모델 가중치는 README에 별도의 공개 조건이 있으며, MIT 라이선스 텍스트에는 명시되어 있지 않음.
- LibriTTS 다중 화자 체크포인트를 통해 5~10초의 참조 클립으로 제로샷 스타일 전송(권장 15~30초).
- 공식 추론에는 GPL-3.0 라이선스인 espeak-ng가 필요함. 커뮤니티 pip 패키지는 이를 피하지만 최신 릴리스는 2024년 1월 11일임.
- 공식 저장소는 2024년 3월 7일 이후 커밋 없음. 아카이브되지 않았으며 GitHub 스타는 6,300개 이상.
- 사전 학습된 체크포인트는 주로 영어임. 텍스트 정렬기(text aligner)는 일본어 및 중국어 말뭉치로도 학습되었으며, 미세 조정 없이도 다른 언어에 어느 정도 일반화된다고 알려져 있음.
📍 한 문장으로
StyleTTS 2는 스타일 확산과 적대적 학습을 통해 자연스러운 음성을 만들어내는 컬럼비아 대학교의 MIT 라이선스 연구급 텍스트 음성 변환 모델로, 사전 학습된 가중치에는 문서 수준의 공개 조건이 있으며 2024년 3월 7일 이후 GitHub 커밋이 없습니다.
💬 쉽게 말하면
기업이 아닌 대학 연구진이 만든, 텍스트를 매우 자연스러운 음성으로 바꿔주는 무료 다운로드 가능한 AI 모델입니다. 코드 라이선스상 상업적 사용도 무료이지만, 자체 안내문에서는 청취자에게 음성이 합성된 것임을 알리도록 요구하고 있으며, 더 이상 아무도 버그를 적극적으로 수정하지 않는 것으로 보입니다.
📌참고: 이 프로젝트에 대한 GitHub 이슈(#37)는 사전 학습된 모델에 대한 README의 공개 요구 사항이 MIT 라이선스 파일 자체 외부에 있다고 지적했으며, 일부 독자는 이를 혼란스럽게 느낍니다. 배포 전에 LICENSE 파일과 README의 모델 사용 섹션을 직접 읽어보십시오 — 자세한 내용은 아래 라이선스 및 비용 섹션을 참고하십시오.
역사: 컬럼비아 대학교의 연구 프로젝트
StyleTTS 2는 컬럼비아 대학교 전기공학과의 연구진—Yinghao Aaron Li, Cong Han, Vinay S. Raghavan, Gavin Mischler, Nima Mesgarani—에 의해 만들어졌으며, "StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models"라는 제목의 NeurIPS 2023 논문으로 발표되었습니다.
논문의 핵심 주장은 스타일 확산(발화 스타일을 단일 고정 벡터가 아닌 잠재 확률 분포로 모델링)과 대형 사전 학습된 음성 언어 모델에 대한 적대적 학습을 결합하면 이전 접근 방식보다 인간과 유사한 발화 변이를 더 정확하게 모델링할 수 있다는 것입니다. 단일 화자 벤치마크인 LJSpeech에서 논문은 StyleTTS 2가 청취자 평가에서 실제 인간 음성 녹음과 동등하거나 이를 능가한다고 보고합니다. 다중 화자 데이터셋인 LibriTTS에서는 제로샷 화자 적응에서 이전에 공개된 모델들을 능가한다고 보고합니다.
공개 GitHub 저장소 yl4579/StyleTTS2는 6,300개 이상의 스타를 모았으며, 아카이브로 표시되어 있지는 않습니다 — 그러나 PromptQuorum이 프로젝트의 공개 커밋 이력을 확인한 결과, 저장소의 메인 브랜치에는 2024년 3월 7일 이후 커밋이 없었습니다. 이는 상업적으로 유지보수되는 오픈소스 제품이라기보다는 대학 연구 발표와 일치하는 패턴입니다. 코드, 논문, 사전 학습된 체크포인트는 연구와 함께 공개되었으며, 지속적인 기능 개발이나 버그 수정 릴리스에 대한 약속은 없습니다.
개발자 Sidharth Rajaram이 만든 커뮤니티 관리 pip 패키지 styletts2는 원래의 연구 코드를 설치 가능한 패키지(pip install styletts2)로 감싸며, GPL-3.0 라이선스인 espeak-ng 음소화 도구를 MIT 라이선스인 gruut 라이브러리로 대체하여 전체 설치 체인을 관대한 라이선스로 유지합니다. PyPI에서 가장 최근 릴리스는 버전 0.1.6으로, 2024년 1월 11일에 게시되었습니다 — 이 리뷰 시점 기준 2년 반 이상 된 것이며, 원래 컬럼비아 대학교 연구 코드와는 별개의 서드파티 프로젝트입니다.
StyleTTS 2는 누가 만들었습니까?
StyleTTS 2는 컬럼비아 대학교 전기공학과 연구진인 Yinghao Aaron Li, Cong Han, Vinay S. Raghavan, Gavin Mischler, Nima Mesgarani가 만들었으며, NeurIPS 2023 논문으로 발표되었습니다.
StyleTTS 2가 실제로 하는 일
StyleTTS 2는 입력 텍스트로부터 멜 스펙트로그램(엔드투엔드 구성에서는 원시 파형)을 생성하는 텍스트 음성 변환 모델로, 잠재적인 "스타일" 벡터를 결정론적으로 예측하는 대신 확산 모델을 사용해 샘플링합니다 — 논문은 이 메커니즘이 더 자연스럽고 인간과 유사한 운율을 만들어낸다고 설명합니다.
- 자연스러운 운율을 위한 스타일 확산. 텍스트로부터 단일 고정 스타일 임베딩을 예측하는 대신, StyleTTS 2는 확산을 통해 학습된 스타일 확률 분포에서 샘플링합니다. 논문에 따르면 이는 결정론적 접근 방식보다 음높이, 리듬, 강조에서 더 자연스러운 변화를 만들어냅니다.
- 음성 언어 모델에 대한 적대적 학습. 학습 과정은 TTS 모델을 판별자 역할을 하는 대형 사전 학습된 음성 언어 모델(SLM)과 경쟁시킵니다. 논문은 이 기법이 LJSpeech 벤치마크에서 인간 녹음 품질과의 남은 격차를 좁혔다고 평가합니다.
- 공식적으로 공개된 두 개의 사전 학습 체크포인트. StyleTTS2-LJSpeech(단일 영어 화자, 24kHz)와 StyleTTS2-LibriTTS(다중 영어 화자) 모두 Hugging Face에 호스팅되어 있습니다.
- 참조 오디오로부터의 제로샷 스타일 전송. LibriTTS 다중 화자 체크포인트는 참조 오디오 클립에서 포착한 스타일로 새로운 텍스트를 합성할 수 있습니다 — 프로젝트 자체 문서와 서드파티 가이드는 최소 5~10초를 설명하며, 정확한 음색, 운율, 발음을 위해 깨끗한 단일 화자 참조 오디오 15~30초를 권장합니다.
- 주로 영어인 사전 학습 체크포인트와 일부 다국어 기초 작업. 공식적으로 공개된 체크포인트는 영어 데이터셋(LJSpeech, LibriTTS)으로 학습되었습니다. 논문은 텍스트 정렬기 구성 요소가 일본어(JVS)와 중국어(AiShell) 말뭉치로도 사전 학습되었으며 "미세 조정 없이도 대부분의 다른 언어에서 잘 작동한다"고 언급하며, 14개 언어를 다루는 다국어 PL-BERT 모델을 직접 비영어권 StyleTTS 2 모델을 학습시키기 위한 출발점으로 참조하고 있습니다 — 하지만 공식적으로 공개된 즉시 사용 가능한 비영어 체크포인트는 없습니다.
StyleTTS 2 설치 및 실행: 단계별 안내
이 안내는 사전 학습된 체크포인트로 추론을 실행하기 위해 프로젝트 자체가 문서화한 설정을 따릅니다.
- 1저장소를 클론하고 의존성을 설치합니다.
Why it matters: `git clone https://github.com/yl4579/StyleTTS2.git && cd StyleTTS2 && pip install -r requirements.txt`를 실행합니다. 이는 프로젝트 자체 requirements 파일에 나열된 핵심 Python 의존성을 설치합니다. - 2phonemizer와 espeak-ng를 설치합니다.
Why it matters: `pip install phonemizer`를 실행하고, Linux에서는 `sudo apt-get install espeak-ng`(또는 사용 중인 OS에 맞는 명령)를 실행합니다. espeak-ng 자체가 GPL-3.0 라이선스라는 점에 유의하십시오 — 이것이 StyleTTS 2 코드 자체뿐 아니라 추론 경로에도 왜 중요한지는 라이선스 및 비용 섹션을 참고하십시오. - 3사전 학습된 체크포인트를 다운로드합니다.
Why it matters: Hugging Face에서 [StyleTTS2-LJSpeech](https://huggingface.co/yl4579/StyleTTS2-LJSpeech/tree/main)(단일 화자) 또는 [StyleTTS2-LibriTTS](https://huggingface.co/yl4579/StyleTTS2-LibriTTS/tree/main)(다중 화자, 스타일 전송 지원)를 프로젝트 디렉터리로 다운로드합니다. - 4제공된 노트북을 통해 추론을 실행합니다.
Why it matters: 프로젝트에는 `Demo/Inference_LJSpeech.ipynb`와 `Demo/Inference_LibriTTS.ipynb`가 포함되어 있습니다 — 다운로드한 체크포인트와 일치하는 것을 Jupyter에서 열어 모델을 로드하고 첫 번째 샘플을 합성합니다. - 5(대안) 더 간단한 MIT 전용 설치 체인을 위해 커뮤니티 pip 패키지를 사용합니다.
Why it matters: `pip install styletts2`를 실행한 다음, `from styletts2 import tts; my_tts = tts.StyleTTS2(); my_tts.inference("안녕하세요.", output_wav_file="test.wav")`를 실행합니다. 이 서드파티 패키지(최신 릴리스 2024년 1월 11일)는 espeak-ng 대신 MIT 라이선스인 gruut 라이브러리를 사용해 GPL-3.0 의존성을 피하지만, 그 대가로 마찬가지로 휴면 상태인 비공식 래퍼에 의존하게 됩니다. - 6(선택 사항) 스타일 전송을 위한 참조 클립을 제공합니다.
Why it matters: LibriTTS 체크포인트를 사용할 때, `target_voice_path` 인자(커뮤니티 패키지) 또는 동등한 참조 오디오 파라미터(공식 노트북)에 깨끗한 15~30초 단일 화자 WAV 파일을 지정하면 해당 포착된 스타일로 새 텍스트를 합성할 수 있습니다.
실제 사용 예시
다음 예시는 커뮤니티 pip 패키지의 단순화된 API와 공식 프로젝트의 추론 노트북에서 사용되는 패턴을 모두 보여줍니다.
- 스타일 전송에는 참조 오디오 품질이 중요합니다. 깨끗한 단일 화자 15~30초 클립은 짧거나, 잡음이 있거나, 다중 화자인 참조보다 눈에 띄게 더 나은 스타일 전송을 만들어냅니다.
- 두 개의 별도 의존성 체인이 존재합니다. 공식 저장소의 노트북 경로는 GPL-3.0 라이선스인 espeak-ng를 끌어들입니다. 커뮤니티 pip 패키지는 대신 gruut를 사용해 이를 피합니다 — 둘 중 하나를 중심으로 도구를 구축하기 전에 라이선스 요구 사항에 맞는 체인을 선택하십시오.
# 가장 간단한 경로: 커뮤니티 pip 패키지(MIT 전용 의존성 체인,
# 최신 릴리스 2024-01-11 — 의존하기 전에 여전히 작동하는지 확인하십시오)
pip install styletts2
from styletts2 import tts
my_tts = tts.StyleTTS2()
my_tts.inference(
"Hello there, this is a natural-sounding synthesized sentence.",
output_wav_file="test.wav",
)
# 참조 클립으로부터의 제로샷 스타일 전송(LibriTTS 유형 체크포인트)
my_tts.inference(
"The same text, now spoken in a captured reference style.",
target_voice_path="reference_voice.wav",
output_wav_file="styled_test.wav",
)
# 커스텀 체크포인트 및 설정 경로
custom_tts = tts.StyleTTS2(
model_checkpoint_path="/path/to/epochs_2nd_00020.pth",
config_path="/path/to/config.yml",
)
# --- 공식 저장소 경로(espeak-ng, GPL-3.0 필요) ---
# git clone https://github.com/yl4579/StyleTTS2.git
# cd StyleTTS2 && pip install -r requirements.txt
# pip install phonemizer && sudo apt-get install espeak-ng
# 그런 다음 Jupyter에서 Demo/Inference_LJSpeech.ipynb 또는
# Demo/Inference_LibriTTS.ipynb를 열어 다운로드한 체크포인트에 대해
# 제공된 셀을 실행합니다.라이선스 및 비용
StyleTTS 2의 코드는 MIT 라이선스를 따릅니다. 이는 공식 저장소의 LICENSE 파일을 통해 확인되었습니다. MIT는 관대한 라이선스로, 최소한의 제한으로 코드를 사용, 수정, 재배포할 수 있으며 상업적 사용도 포함됩니다.
사전 학습된 모델 가중치는 LICENSE 파일 자체가 아닌 README에 명시된, 라이선스와는 별개의 조건을 갖고 있습니다. 프로젝트의 README는 사용자에게 "합성하려는 목소리를 사용할 허가가 없는 한, 음성 샘플이 StyleTTS 2 모델에 의해 합성되었음을 청취자에게 알릴 것"을 요청합니다. 이는 문서 수준의 요청이며, 공식적인 라이선스 조항이 아닙니다 — 이 프로젝트에 대한 GitHub 이슈(#37)는 README의 모델 사용 섹션까지 읽지 않는 독자에게는 저장소의 라이선스 배지와 LICENSE 파일이 MIT 조건만 적용된다고 암시하기 때문에 이것이 잠재적으로 혼란스러울 수 있다고 명시적으로 지적했습니다. PromptQuorum은 공개 이슈 스레드에서 이 모호함을 해소하는 유지 관리자의 답변을 찾지 못했습니다. 공개 조건을 저자의 실제이고 문서화된 요청으로 취급하고 이를 준수하되, 이것이 코드 자체에 대한 공식 MIT 부여 외부에 있다는 점을 이해하십시오. 이는 상업적 사용 전에 짚고 넘어갈 만한, 실제로 이례적인 구조입니다.
공식 추론을 실행하려면 GPL-3.0 라이선스 의존성인 espeak-ng가 필요합니다. 프로젝트 자체의 설치 지침은 pip install phonemizer에 더해 시스템 수준의 espeak-ng 설치를 요구하며, espeak-ng는 GPL-3.0 라이선스입니다. GPL-3.0은 MIT와는 다른 배포 의무를 갖는 카피레프트 라이선스입니다. 수정되지 않은 외부 시스템 의존성으로 espeak-ng를 사용하는 것은 일반적으로 그 수정된 소스를 정적으로 링크하거나 재배포하는 것과는 다르게 취급되지만, 정확한 경계는 배포 방식에 따라 달라집니다. 커뮤니티 pip 패키지 styletts2는 espeak-ng 대신 MIT 라이선스인 gruut 라이브러리를 사용함으로써 이 특정 문제를 피합니다 — 완전히 관대한 라이선스의 의존성 체인을 원한다면 실질적인 차이이지만, 그 대가로 공식 저장소보다 최신 릴리스 날짜(2024년 1월 11일)가 더 오래된 서드파티 패키지에 의존하게 됩니다.
이 중 어느 것도 법률 자문이 아닙니다. 상업 제품에 StyleTTS 2를 출시하기 전에 LICENSE 파일, README의 모델 사용 섹션을 읽고 구체적인 배포에 대해 변호사와 상담하십시오.
StyleTTS 2는 어떤 라이선스를 사용합니까?
StyleTTS 2의 코드는 MIT 라이선스를 따릅니다. 사전 학습된 모델 가중치는 프로젝트의 README에 별도의, 라이선스와는 별개의 조건(화자의 허가가 없는 한 합성 음성임을 공개해야 함)을 갖고 있으며, 이는 공식 MIT 라이선스 텍스트의 일부가 아닙니다 — 이 프로젝트에 대한 GitHub 이슈는 이러한 구분이 잠재적으로 혼란스러울 수 있다고 지적했습니다. 이는 법률 자문이 아닙니다. 상업적 사용 전에 LICENSE 파일과 README를 직접 읽어보십시오.
StyleTTS 2가 적합하지 않은 경우
StyleTTS 2는 출력 품질이 진정으로 뛰어난 연구급 모델이지, 세련되고 적극적으로 유지보수되는 소비자 제품이 아닙니다. 다음과 같은 상황에는 적합하지 않은 도구입니다:
- 간단한 pip 설치 후 바로 사용하는 경험을 원하는 독자.
pip install piper-tts와 단일 CLI 명령만으로 작동하는 오디오를 얻을 수 있는 Piper와 달리, StyleTTS 2의 공식 경로는 연구 저장소 클론, phonemizer 설치, 시스템 수준 espeak-ng 의존성, Jupyter 노트북 실행을 수반합니다 — 눈에 띄게 더 높은 설정 장벽입니다. - ML 엔지니어링 노력 없는 프로덕션 배포. 유지보수되는 웹 서버 모드가 없고, 공식 Docker 이미지도 없으며, 지속적인 지원을 뒷받침하는 회사도 없습니다. StyleTTS 2를 프로덕션에 배포하는 사람은 연구 코드 주변에 자체 서빙 레이어를 작성하고 유지보수해야 할 것으로 예상해야 합니다.
- 보장된 지속적인 버그 수정이나 기능 업데이트. 공식 저장소에 2024년 3월 7일 이후 커밋이 없고 커뮤니티 pip 패키지의 최신 릴리스가 2024년 1월 11일이므로, 두 의존성 체인 모두 적극적인 유지보수가 이루어진다고 가정하지 마십시오 — 발생하는 문제에 대해 스스로 해결해야 할 가능성을 예산에 포함하십시오.
- 즉시 사용 가능한 비영어 음성. 공식적으로 공개된 사전 학습 체크포인트(LJSpeech, LibriTTS)는 영어 전용입니다. 논문의 다국어 텍스트 정렬기와 PL-BERT에 대한 설명에 따르면 비영어 모델을 직접 학습시키는 것은 아키텍처상 가능하지만 자체 학습 실행이 필요합니다 — 프로젝트에서 다운로드 가능한 비영어 체크포인트는 없습니다.
- 다운로드하는 모든 것에 대한 단일하고 명확한 라이선스 부여. 코드(MIT)와 사전 학습된 가중치(MIT에 README 공개 조건 추가)가 약간 다르게 규정되고 공식 추론 경로가 GPL-3.0 의존성을 끌어들이기 때문에, StyleTTS 2는 Bark(완전히 MIT, 추가 조건 없음) 같은 프로젝트가 가진 단일하고 간단한 라이선스 이야기를 제공하지 않습니다.
StyleTTS 2의 대안
Piper
- 최적 용도:
- 간단한 pip 설치 후 바로 사용, 가장 빠른 CPU 전용 합성, Raspberry Pi에서 실시간 동작
- 라이선스:
- GPL-3.0-or-later
XTTS v2
- 최적 용도:
- 6초 참조 오디오로부터의 패키지화된 보이스 클로닝, 17개 언어 지원
- 라이선스:
- CPML(비상업적)
Coqui TTS
- 최적 용도:
- 폭넓은 언어 지원과 유지보수되는 포크를 갖춘 유연한 멀티 백엔드 툴킷
- 라이선스:
- MPL-2.0
Bark
- 최적 용도:
- 표현력 있는 비언어 오디오 — 웃음, 한숨, 주변음, 단일하고 명확한 MIT 라이선스
- 라이선스:
- MIT
ElevenLabs
- 최적 용도:
- 상업적 보이스 클로닝과 적극적인 지원을 갖춘 관리형 클라우드 API, 셀프 호스팅 불필요
- 라이선스:
- 독점(유료 클라우드 API)
자주 묻는 질문
StyleTTS 2는 무엇입니까?
StyleTTS 2는 컬럼비아 대학교 연구진이 만든 오픈소스 텍스트 음성 변환 모델로, 스타일 확산과 대형 음성 언어 모델을 활용한 적대적 학습을 통해 자연스러운 음성을 생성하며, NeurIPS 2023 논문으로 발표되었습니다.
StyleTTS 2는 상업적으로 무료로 사용할 수 있습니까?
코드는 MIT 라이선스이며 상업적 사용을 허용합니다. 사전 학습된 모델 가중치는 README에 별도의, 라이선스와는 별개의 조건이 있으며, 화자의 허가가 없는 한 합성 음성임을 공개하도록 요구합니다. 이는 법률 자문이 아닙니다. 상업적 배포 전에 LICENSE 파일과 README를 직접 읽어보십시오.
StyleTTS 2는 음성을 복제할 수 있습니까?
LibriTTS 다중 화자 체크포인트는 참조 오디오 클립(최소 5~10초, 권장 15~30초)으로부터의 제로샷 스타일 전송을 지원하며, 이는 정신적으로 보이스 클로닝과 유사합니다. XTTS v2처럼 간단한 한 줄짜리 클로닝 기능으로 패키징되어 있지는 않으며, 사용하려면 노트북 기반 공식 워크플로우나 커뮤니티 pip 패키지가 필요합니다.
StyleTTS 2는 아직 유지보수되고 있습니까?
공식 GitHub 저장소는 아카이브로 표시되어 있지 않지만, PromptQuorum은 2024년 3월 7일 이후의 커밋을 찾지 못했습니다. 설치를 간소화하는 커뮤니티 pip 패키지는 2024년 1월 11일에 마지막으로 릴리스되었습니다. 둘 다 적극적으로 개발되는 소프트웨어가 아니라 휴면 상태의 연구 산출물로 취급하십시오.
StyleTTS 2는 영어 외의 언어를 지원합니까?
공식적으로 공개된 사전 학습 체크포인트(LJSpeech, LibriTTS)는 영어 전용입니다. 논문은 텍스트 정렬기 구성 요소가 일본어와 중국어 말뭉치로도 학습되었으며 미세 조정 없이도 다른 언어에 어느 정도 합리적으로 일반화된다고 언급하며, 14개 언어를 다루는 다국어 PL-BERT 모델을 자체 비영어 모델을 학습시키기 위한 출발점으로 참조합니다 — 하지만 공식적으로 공개된 즉시 사용 가능한 비영어 체크포인트는 없습니다.
StyleTTS 2의 공식 설치에 espeak-ng가 필요한 이유는 무엇이며, 왜 중요합니까?
공식 추론 경로는 텍스트를 음소로 변환하는 백엔드로 espeak-ng를 사용하는 phonemizer 라이브러리를 사용합니다. espeak-ng는 GPL-3.0 라이선스이며, 이는 MIT와는 다른 배포 의무를 갖는 카피레프트 라이선스입니다. 커뮤니티 pip 패키지(styletts2)는 대신 MIT 라이선스인 gruut 라이브러리를 사용해 이를 피하지만, 그 대가로 더 오래된 비공식 릴리스(마지막 업데이트 2024년 1월 11일)에 의존하게 됩니다.
StyleTTS 2는 XTTS v2와 비교해 어떻습니까?
StyleTTS 2의 코드는 MIT 라이선스이며 상업적으로 무료로 사용할 수 있습니다(가중치에 대한 README 공개 조건 포함). XTTS v2는 비상업적인 Coqui Public Model License를 따릅니다. StyleTTS 2의 공식 설정은 더 연구급이며 더 많은 수동 작업이 필요합니다. XTTS v2는 Coqui TTS 툴킷을 통해 더 간단하고 패키지화된 보이스 클로닝 API를 제공합니다. 라이선스 요구 사항과 설정 복잡성에 대한 감수 수준에 따라 선택하십시오.
결론
StyleTTS 2는 출력 품질 면에서 여전히 진정으로 인상적입니다. 스타일 확산과 적대적 학습을 결합한 접근 방식은 자체 NeurIPS 논문에서 LJSpeech 벤치마크에서 인간 녹음 품질과 동등하거나 이를 능가한다고 평가되며, 코드 라이선스(MIT)는 가능한 한 관대합니다. 대부분의 독자에게 쉽게 추천하기 어렵게 만드는 것은 이 핵심 모델을 둘러싼 모든 것입니다. 공식 MIT 부여 외부에 있는 사전 학습 가중치에 대한 문서 수준의 공개 조건, GPL-3.0 의존성을 끌어들이는 공식 추론 경로, 그 의존성을 피하지만 그 자체로 2년 반 이상 지난 커뮤니티 pip 패키지, 그리고 2024년 3월 7일 이후 공식 저장소에 커밋이 없다는 점입니다. 로컬에서 얻을 수 있는 최고의 자연스러운 영어 내레이션 품질을 원하고 연구급 설정과 유지보수되지 않는 의존성 체인을 감수할 수 있다면, StyleTTS 2는 이를 실현해 줍니다. 더 간단한 설치, 적극적인 유지보수, 또는 패키지화된 보이스 클로닝을 원한다면, 이 리뷰를 PromptQuorum의 빠른 CPU 전용 합성을 위한 Piper, 패키지화된 보이스 클로닝을 위한 XTTS v2, 또는 완전히 관리되는 대안을 위한 ElevenLabs 비교 리뷰와 함께 참고하십시오. 이 리뷰는 PromptQuorum이 심층적으로 다룬 여섯 개의 로컬 음성 인식 및 음성 합성 엔진 중 마지막으로, Whisper.cpp, Faster Whisper, Piper, Coqui TTS, XTTS v2, Bark와 나란히 위치합니다.
출처
- GitHub의 StyleTTS 2 — 공식 저장소: README, LICENSE, 설치 지침, 커밋 이력.
- StyleTTS 2 논문(arXiv) — "Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models", NeurIPS 2023 논문.
- GitHub 이슈 #37: Possibly misleading license info — MIT LICENSE 파일과 README의 모델 사용 공개 조건 사이의 커뮤니티가 지적한 불일치.
- PyPI의 styletts2 — 커뮤니티가 관리하는 pip 패키지(Sidharth Rajaram), 버전 0.1.6, 2024년 1월 11일 게시.
- StyleTTS2-LJSpeech 및 StyleTTS2-LibriTTS — Hugging Face의 공식 사전 학습 체크포인트.
- 로컬 TTS 및 보이스 클로닝 라이선스 — 로컬 TTS 엔진 간 전체 라이선스 비교.
