핵심 요점
- Piper는 속도와 임베디드 사용에 올바른 선택입니다. 완전히 CPU에서 동작하며, Raspberry Pi 5에서 실시간으로 음성을 생성하고 다운로드 가능한 음성 패키지를 통해 20개 이상의 언어를 지원합니다. MIT 라이선스.
- XTTS v2는 2026년 최고의 로컬 음성 복제 옵션입니다 — 하지만 비상업용입니다. 6초의 참조 오디오로 17개 언어에서 음성을 복제합니다(GPU 4~6 GB VRAM). CPML 라이선스는 비상업용이며, Coqui가 문을 닫은(2024년 1월) 이후 상업용 라이선스를 판매하지 않으므로 — XTTS v2를 비상업용으로만 취급하십시오. Docker/CI에서
COQUI_TOS_AGREED=1로 CPML을 비대화형으로 수락합니다. - F5-TTS는 zero-shot 음성 복제에서 가장 빠르게 성장하는 대안입니다. GPT 대신 flow-matching 아키텍처를 사용하며, ~3초의 참조 오디오로 음성을 복제하고, 더 빠른 추론 속도로 XTTS v2와 경쟁적인 품질을 달성합니다. 라이선스: CC-BY-NC-4.0(비상업용).
- Coqui TTS는 가장 유연한 오픈소스 TTS 툴킷입니다. MPL 2.0 라이선스 하에 다양한 백엔드(Tacotron2, VITS, XTTS), 음성 복제, 20개 이상의 언어를 지원합니다. 참고: Coqui 회사는 2024년 1월에 문을 닫았으며, 프로젝트는 현재 커뮤니티에서 유지 관리합니다.
- Bark는 비음성 오디오를 생성하는 유일한 로컬 TTS입니다. 음성과 함께 웃음, 기침, 한숨, 음악 조각, 환경 음향 효과를 생성할 수 있습니다 — 창의적 오디오, 팟캐스트 제작, 인터랙티브 픽션에 유용합니다. 출력이 느리고 비결정적입니다.
- StyleTTS 2는 오픈소스 영어 TTS 엔진 중 가장 높은 MOS를 달성합니다. 확산 기반 스타일 전달이 영어 내레이션에서 거의 인간에 가까운 자연스러움을 생성합니다. 영어 전용이며 음성 복제를 지원하지 않습니다.
- 라이선스가 상업적 사용을 결정하며 — 구분은 명확합니다. 상업용 제품에 무료: Piper, Bark, StyleTTS 2(MIT)와 Kokoro, Tortoise(Apache 2.0). 조건부 상업적: Coqui TTS 툴킷(MPL 2.0, 툴킷 수정 사항 공개). 비상업용만: XTTS v2(CPML)와 F5-TTS(CC-BY-NC-4.0) — 둘 다 별도 계약 필요. 상업적 음성 복제에는 Tortoise(Apache 2.0) 또는 VITS 백엔드의 Coqui 툴킷(MPL 2.0)을 사용하십시오. 사실 참고 자료이며 법률 자문이 아닙니다.
- 어떤 엔진도 대규모 상업적 TTS의 품질과 동등하지 않습니다. ElevenLabs, Google TTS, Azure TTS는 여전히 로컬 엔진을 능가합니다. 로컬 TTS는 프라이버시, 비용, 오프라인 운영이 중요할 때 올바른 선택입니다.
빠른 사실
- 가장 빠른 로컬 TTS: Piper — Raspberry Pi 5에서 실시간, 최신 데스크톱 CPU에서 실시간보다 ~10배 빠름.
- 최고의 음성 복제 품질: XTTS v2 — 6초의 참조 오디오, 17개 언어로 다국어 복제.
- 가장 빠른 zero-shot 음성 복제: F5-TTS — ~3초의 오디오, flow-matching, RTX 4070에서 ~3~5배 실시간.
- 가장 유연한 오픈소스 툴킷: Coqui TTS — VITS, Tacotron2, XTTS 백엔드 지원, 20개 이상의 언어 모델.
- 유일한 생성적 오디오: Bark — 웃음, 한숨, 음악, 환경음. 모든 엔진 중 가장 느림.
- 최고의 영어 내레이션 품질: StyleTTS 2 — 확산 기반 스타일 전달, LJSpeech 벤치마크에서 거의 인간에 가까운 MOS.
- 상업적 사용 무료: Piper, Bark, StyleTTS 2(MIT); Kokoro, Tortoise(Apache 2.0); Coqui TTS 툴킷(MPL 2.0, 조건부). 비상업용: XTTS v2(CPML), F5-TTS(CC-BY-NC-4.0).
- XTTS v2 음성 및 언어: 고정된 음성 목록이 없습니다 — 6초의 참조 클립을 제공하면 그 음성을 복제합니다. 모델에는 내장 화자 프리셋이 함께 제공되며, 17개 언어로 생성합니다: en, es, fr, de, it, pt, pl, tr, ru, nl, cs, ar, zh-cn, ja, hu, ko, hi.
- XTTS v2 VRAM: 모델 가중치 ~2 GB; 실행에 최소 4 GB, 실시간 추론에 4~6 GB 권장.
- CI/Docker에서 CPML 수락:
export COQUI_TOS_AGREED=1— 대화형 프롬프트가 필요 없습니다. - VRAM 요구 사항: Piper: CPU 전용. Kokoro: CPU / 1~2 GB. StyleTTS 2: 2~4 GB. Coqui VITS: 2~4 GB. F5-TTS: 3~5 GB. XTTS v2: 4~6 GB. Bark: 4~8 GB. Tortoise: 4~8 GB.
로컬 TTS가 중요한 이유
클라우드 TTS 서비스(ElevenLabs, Google TTS, Amazon Polly, Azure Speech)는 편리하지만 문자당 청구, 오디오 데이터 보존 정책, 네트워크 왕복 지연 시간이라는 세 가지 문제가 있습니다. 로컬 TTS는 이 세 가지 문제를 모두 해결합니다.
- 프라이버시: 텍스트 콘텐츠가 컴퓨터를 벗어나지 않습니다. 의료 받아쓰기, 법적 요약, 기밀 문서 낭독에 필수적입니다.
- 비용: 클라우드 TTS 가격은 일반적으로 백만 문자당 $4~$30입니다. 월 1천만 문자를 생성하는 개발자는 로컬 설정으로 월 $40~$300을 절약할 수 있습니다.
- 지연 시간: 네트워크 왕복 없음. Piper는 CPU에서 50ms 미만에 첫 오디오 토큰을 생성합니다.
- 사용자 지정: 음성 복제(XTTS v2, F5-TTS, Coqui)는 몇 초의 오디오에서 사용자 지정 음성을 만들 수 있습니다.
- 오프라인 운영: 비행기, 보안 시설, 인터넷이 없는 원격 지역에서 작동합니다.
- 스마트 홈: Piper는 항상 켜져 있는 로컬 음성 인터페이스를 위한 주요 TTS 레이어입니다 — Raspberry Pi에서 실시간, GPU 불필요. 스마트 홈용 로컬 음성 어시스턴트 →를 참조하십시오.
비교 표
프로덕션 배포를 위한 가장 중요한 지표에서 비교한 모든 로컬 TTS 엔진.
📍 한 문장으로
Piper는 CPU에서 가장 빠르고, XTTS v2는 최고의 음성 복제 품질을 제공하며, F5-TTS는 더 새로운 아키텍처로 zero-shot 복제를 제공하고, Bark는 웃음과 음악을 생성하는 유일한 엔진이며, StyleTTS 2는 영어 내레이션에서 최고의 자연스러움을 갖습니다.
💬 쉽게 말하면
대부분의 오프라인 TTS 요구에 대해: 속도와 단순성을 원하면 Piper, 허용적 라이선스의 음성 복제를 원하면 Coqui, GPU가 있고 최고의 복제 품질을 원하면 XTTS v2, 더 빠른 zero-shot 복제를 원하면 F5-TTS를 사용하십시오.
| 도구 | 품질 | 속도 | 음성 복제 | 다국어 | VRAM | 라이선스 | MOS(영어) |
|---|---|---|---|---|---|---|---|
| Piper | 좋음 | 매우 빠름(CPU) | 없음 | 예(20개+ 언어) | CPU 전용 | MIT | ~3.5 |
| Kokoro | 매우 좋음 | 빠름(CPU) | 없음 | 영어 + 확장 중 | CPU / 1~2 GB | Apache 2.0 | ~4.0 |
| Coqui TTS | 매우 좋음 | 보통 | 있음 | 예(20개+ 언어) | 2~4 GB | MPL 2.0 | ~3.8 |
| XTTS v2 | 우수 | 느림 | 있음(최고) | 예(17개 언어) | 4~6 GB | CPML(비상업용) | ~4.1 |
| F5-TTS | 우수 | 보통~빠름 | 있음(zero-shot) | 예(다국어) | 3~5 GB | CC-BY-NC-4.0 | ~4.1 |
| Bark | 독특함/가변적 | 느림 | 제한적 | 예(다국어) | 4~8 GB | MIT | ~3.2~4.0(가변적) |
| StyleTTS 2 | 우수(영어) | 보통 | 없음 | 주로 영어 | 2~4 GB | MIT | ~4.3 |
| Tortoise | 우수 | 매우 느림(문장당 수 분) | 있음 | 주로 영어 | 4~8 GB | Apache 2.0 | ~4.2 |
MOS(mean opinion score)는 1~5 척도로 5가 인간 음성과 구별할 수 없음을 의미합니다. 점수는 근사치이며 공개된 벤치마크 또는 커뮤니티 평가를 기반으로 합니다. 인간 참조 MOS: ~4.5.

첫 오디오 지연 시간 비교
첫 오디오 지연 시간은 텍스트 입력부터 첫 번째 청취 가능한 출력까지의 시간입니다. 음성 어시스턴트와 인터랙티브 애플리케이션에 필수적입니다.
| 엔진 | 첫 오디오(RTX 4070) | 첫 오디오(CPU) | 첫 오디오(M5 Pro) |
|---|---|---|---|
| Piper | ~30 ms | ~50 ms | ~40 ms |
| Kokoro | ~50 ms | ~80 ms | ~60 ms |
| Coqui VITS | ~100 ms | ~300 ms | ~150 ms |
| StyleTTS 2 | ~150 ms | ~500 ms | ~200 ms |
| F5-TTS | ~200 ms | ~800 ms | ~300 ms |
| XTTS v2 | ~300 ms | ~1500 ms | ~500 ms |
| Bark | ~500 ms | ~3000 ms | ~800 ms |
Piper TTS — 가장 빠른 경량 옵션
Piper는 홈 자동화 및 임베디드 사용을 위해 Rhasspy가 개발한 빠른 로컬 음성 합성 시스템입니다. onnxruntime 백엔드를 갖춘 VITS 기반 신경망 아키텍처를 사용하며, GPU 없이 Raspberry Pi 4 또는 5에서 실시간으로 동작합니다.
- 아키텍처: ONNX 추론이 있는 VITS 신경망 TTS. 단일 보드 컴퓨터와 임베디드 Linux용으로 설계.
- 설치:
pip install piper-tts. 사전 학습된 음성 패키지는 Hugging Face의 Piper voices 저장소에서 사용 가능합니다. - 음성 패키지: 20개 이상의 언어, 언어당 다양한 음성 옵션. 각 음성 패키지는 20~200 MB의 ONNX 모델 파일입니다.
- 속도: 최신 데스크톱 CPU에서 실시간보다 ~10배 빠릅니다. Raspberry Pi 5에서 실시간. 첫 오디오 지연 시간 50ms 미만.
- Apple Silicon: M5 Pro에서 ~15배 실시간(CPU, ARM NEON).
- 이상적인 용도: 홈 어시스턴트, 키오스크 장치, 임베디드 음성 인터페이스, GPU가 없는 프라이버시 중심의 낭독.
- 제한 사항: 음성 복제 없음. 품질은 "좋음" — XTTS v2 또는 StyleTTS 2에 비해 명확히 합성음으로 들립니다.
- 라이선스: MIT — 완전한 상업적 사용 가능.
- 샘플 듣기: Piper 음성 샘플
- Kokoro TTS — Piper의 대안: Kokoro TTS는 CPU에서 빠른 속도를 유지하면서 Piper보다 더 자연스러운 음질을 달성합니다. Apache 2.0 라이선스. Kokoro
Coqui TTS — 최고의 오픈소스 툴킷
Coqui TTS는 다양한 모델 아키텍처와 음성 복제를 지원하는 Python 음성 합성 툴킷입니다. Coqui 회사(2024년 1월에 문을 닫음)가 개발했으며 현재는 오픈소스 커뮤니티에서 유지 관리하고 있습니다. 툴킷은 Tacotron2, VITS, XTTS 백엔드를 지원합니다.
- 설치:
pip install TTS. 모델은 첫 사용 시 자동으로 다운로드됩니다. - 백엔드 옵션: VITS(가장 빠름, 좋은 품질), Tacotron2(구형, 더 느림), XTTS(최고 품질).
- 언어:
tts --list_models를 통해 20개 이상의 언어 모델 사용 가능. - VRAM: VITS 백엔드: 2~4 GB; XTTS 백엔드: 4~6 GB.
- Apple Silicon: M5 Pro에서 ~8배 실시간(CPU). Metal GPU 가속 없음.
- 커뮤니티 현황: Coqui Inc는 2024년 1월에 문을 닫았습니다. 오픈소스 저장소(
coqui-ai/TTS)는 커뮤니티에서 유지 관리합니다. 활성 상업적 지원은 없습니다. - 라이선스: MPL 2.0 — 상업적 사용 허용, 단 수정 사항의 소스 코드를 공개해야 합니다.
- 이상적인 용도: 허용적 라이선스의 오픈소스 툴킷으로 음성 복제를 원하는 개발자.
XTTS v2 — 최고의 음성 복제 품질
XTTS v2(Coqui 제작)는 2026년 로컬에서 사용 가능한 최고 품질의 음성 복제 엔진입니다. 크로스 언어 전달이 있는 GPT 기반 아키텍처를 사용합니다.
- 음성 복제: 6초의 참조 오디오로 설득력 있는 음성 복제가 가능합니다. 3초도 허용 가능한 품질을 생성합니다.
- 다국어 복제: 한 언어로 음성을 복제하고 동일한 음성 특성으로 17개 언어에서 말하기를 생성합니다.
- 언어(17개): 영어, 스페인어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 폴란드어, 터키어, 러시아어, 네덜란드어, 체코어, 아랍어, 중국어(zh-cn), 일본어, 헝가리어, 한국어, 힌디어. 한국어와 힌디어는 XTTS v2.0.3에서 추가되었습니다.
- "XTTS v2 음성": 이름이 지정된 고정 음성 카탈로그는 없습니다. XTTS v2는 복제 모델입니다 — 6초의 참조 클립을 제공하면 해당 화자를 재현합니다. 저장소에는 빠른 테스트를 위한 몇 가지 내장 화자 프리셋이 제공되지만, 의도된 워크플로는 자신의
speaker_wav를 제공하는 것입니다. - VRAM: 모델 가중치는 ~2 GB입니다. 4 GB VRAM이 실질적인 최소치이며, 실시간 추론에는 4~6 GB가 권장됩니다. CPU에서도 동작하지만 ~5~10배 느립니다.
- 속도: 느림 — RTX 4070에서 ~2배 실시간. 실시간 음성 어시스턴트 파이프라인에 적합하지 않습니다.
- Apple Silicon: M5 Pro에서 ~3배 실시간(CPU, Metal 가속 없음).
- 샘플 듣기: Hugging Face의 XTTS v2 데모
- 라이선스: CPML(Coqui Public Model License) — 비상업용. CPML은 모델 및 그 오디오 출력의 개인, 연구, 취미 용도를 허용하지만, 별도의 상업용 계약 없이는 상업적 사용(유료 제품, SaaS, 광고 지원 콘텐츠, 클라이언트 작업)을 금지합니다. Coqui Inc가 2024년 1월에 문을 닫았으므로 현재 XTTS v2 상업용 라이선스를 판매하는 주체가 없습니다 — 실질적으로 XTTS v2를 비상업용으로만 취급하십시오.
COQUI_TOS_AGREED환경 변수는 CPML 비대화형 수락 섹션을 참조하십시오.
from TTS.api import TTS
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to("cuda")
tts.tts_to_file(
text="안녕하세요, 저는 당신의 음성 어시스턴트입니다.",
speaker_wav="reference_voice.wav",
language="ko",
file_path="output.wav"
)⚠️Warning: XTTS v2는 CPML(비상업용) 라이선스의 적용을 받습니다. 상업적 사용 — 제품, SaaS, 서비스 또는 유료 클라이언트 작업 — 에는 별도의 상업용 계약이 필요하며, Coqui Inc가 2024년 1월에 문을 닫았으므로 현재 그러한 계약을 구매할 수 없습니다. 상업적 음성 복제가 필요한 경우 Tortoise(Apache 2.0) 또는 VITS 백엔드의 Coqui TTS 툴킷(MPL 2.0)을 사용하십시오. 이는 사실 참고 자료이며 법률 자문이 아닙니다 — 배포 전에 CPML을 직접 읽으십시오.
Bark — 음성을 넘어선 생성적 오디오
Bark(Suno AI 제작)는 텍스트 프롬프트에서 음성, 음악, 웃음, 기침, 한숨 및 환경음을 생성하는 텍스트-오디오 생성 모델입니다.
- 고유한 기능: 텍스트에 `[laughs]
,[sighs],[music]`를 포함하면 Bark가 음성과 함께 해당 사운드를 생성합니다. - 속도: 느림 — RTX 4090에서도 실시간보다 2~4배 느립니다.
- Apple Silicon: M5 Pro에서 ~1.5배 실시간(CPU, 부분적 MPS).
- 이상적인 용도: 창의적 오디오, 음향 효과가 있는 팟캐스트 제작, 인터랙티브 픽션.
- VRAM: GPU 4~8 GB.
- 설치:
pip install suno-bark. 모델은 첫 실행 시 다운로드됩니다(~2 GB). - 라이선스: MIT — 완전한 상업적 사용 가능.
- 제한 사항: 신뢰할 수 있는 음성 복제 없음.
StyleTTS 2 — 최고의 자연스러운 품질
StyleTTS 2는 LJSpeech 벤치마크에서 거의 인간에 가까운 MOS를 달성하는 확산 기반 TTS 모델입니다.
- 품질: LJSpeech 벤치마크에서 오픈소스 영어 TTS 엔진 중 가장 높은 MOS 점수.
- 이상적인 용도: 오디오북 내레이션, 전문 보이스오버, 팟캐스트 제작.
- 설치: GitHub 저장소 클론,
pip install -r requirements.txt, 모델 체크포인트 다운로드(~500 MB). - 언어 지원: 주로 영어. 영어 이외의 언어 사용은 권장하지 않습니다.
- 음성 복제: 지원되지 않습니다.
- VRAM: GPU 2~4 GB. RTX 4070에서 ~5~8배 실시간.
- 라이선스: MIT — 완전한 상업적 사용 가능.
- 샘플 듣기: GitHub의 StyleTTS 2
F5-TTS — Zero-shot 음성 복제, 완전 개방형
F5-TTS는 zero-shot 음성 복제가 있는 flow-matching 기반 TTS 모델로 — fine-tuning 없이 ~3초의 참조 오디오에서 모든 음성을 복제합니다.
- 아키텍처: Flow-matching(확산의 변형). 일반적으로 경쟁력 있는 품질로 더 빠른 추론을 제공합니다.
- 음성 복제: ~3초의 참조 오디오로 zero-shot 음성 복제가 가능합니다.
- 품질: 영어에서 XTTS v2와 경쟁적. 커뮤니티 평가에서 MOS 약 ~4.1.
- 속도: RTX 4070에서 ~3~5배 실시간.
- VRAM: GPU 3~5 GB 권장.
- 설치:
pip install f5-tts또는 GitHub에서 클론. - 라이선스: CC-BY-NC-4.0 — 비상업적 사용만 가능.
- 중요한 이유: XTTS v2가 너무 느리거나 CPML 라이선스가 우려되는 경우 F5-TTS가 주요 대안입니다.
라이선스 및 상업적 사용 — 이 TTS 엔진을 상업적으로 사용할 수 있습니까?
라이선스는 프로덕션 사용에서 가장 중요한 단일 요소이며, 이 엔진들을 명확하게 두 그룹으로 나눕니다. 허용적 라이선스 엔진(MIT, Apache 2.0)은 상업용 제품에 무료로 출시할 수 있습니다. 제한된 엔진(CPML, CC-BY-NC-4.0)은 비상업용입니다 — 유료 제품, SaaS, 광고 지원 콘텐츠 또는 클라이언트 작업에 사용하려면 별도 계약이 필요합니다. 아래 표는 각 엔진의 정확한 라이선스와 "상업적으로 사용할 수 있는가?"에 대한 직접적인 답변을 제공합니다.
📍 한 문장으로
상업용 제품의 로컬 TTS의 경우 Piper, Bark, StyleTTS 2(MIT), Kokoro와 Tortoise(Apache 2.0), 그리고 VITS/Tacotron2 백엔드의 Coqui TTS 툴킷(MPL 2.0)이 모두 허용됩니다. XTTS v2(CPML)와 F5-TTS(CC-BY-NC-4.0)는 비상업용입니다.
💬 쉽게 말하면
가장 인기 있는 두 음성 복제 모델 — XTTS v2와 F5-TTS — 는 별도 라이선스 없이는 상업적으로 사용할 수 없습니다. 상업적 음성 복제에는 Tortoise(Apache 2.0) 또는 VITS 백엔드의 Coqui 툴킷(MPL 2.0)이 안전한 선택입니다.
| 도구 | 라이선스 | 상업적 가능? | 주요 조건 |
|---|---|---|---|
| Piper | MIT | 예 — 제한 없음 | MIT 고지 포함; 음성별 모델 라이선스 확인 |
| Kokoro | Apache 2.0 | 예 — 제한 없음 | Apache 2.0 고지 포함 |
| Coqui TTS (툴킷) | MPL 2.0 | 예 — 조건 있음 | 툴킷 파일에 대한 수정 사항의 소스 공개 |
| XTTS v2 (모델) | CPML | 아니오 — 비상업용 | 상업용에는 계약 필요; Coqui가 문을 닫은(2024년 1월) 이후 판매처 없음 |
| F5-TTS | CC-BY-NC-4.0 | 아니오 — 비상업용 | NC는 fine-tune에도 이어짐(Emilia 학습 데이터) |
| Bark | MIT | 예 — 제한 없음 | MIT 저작권 고지 포함 |
| StyleTTS 2 | MIT | 예 — 제한 없음 | MIT 저작권 고지 포함 |
| Tortoise | Apache 2.0 | 예 — 제한 없음 | 저작자 표시; 복제 음성에 대한 동의 확보 |

📌Note: Coqui TTS(툴킷, MPL 2.0)와 XTTS v2(특정 모델 가중치, CPML)는 서로 다른 라이선스를 가집니다. VITS 또는 Tacotron2 백엔드의 Coqui TTS 툴킷은 MPL 2.0 하에 상업용 제품에 출시할 수 있습니다. CPML 비상업용 제한은 특히 XTTS v2 모델 가중치와 그 오디오 출력에 적용되며 — 툴킷 코드에는 적용되지 않습니다.
⚠️Warning: 이는 사실 참고 자료이며 법률 자문이 아닙니다. 라이선스는 변경되며 예외 사례(음성 동의, 데이터셋 조건, 음성별 모델 라이선스)가 중요합니다. 상업적 배포를 위해 이러한 조건에 의존하기 전에 각 엔진의 라이선스 파일을 직접 읽고 변호사와 상담하십시오.
CPML(Coqui Public Model License)이란 무엇입니까?
Coqui Public Model License(CPML)는 XTTS v2 모델 가중치를 규정하는 구체적인 법률 문서입니다 — Coqui TTS 툴킷 코드의 라이선스(MPL 2.0)와는 다르며, 오픈소스 라이선스도 아닙니다. Coqui AI는 CPML을 "소스 공개형" 비상업용 라이선스로 발행했습니다: 모델 가중치는 공개적으로 다운로드할 수 있지만, 라이선스 문서는 상업적 이용 권리를 명시적으로 배제합니다. Coqui Inc가 2024년 1월에 문을 닫았기 때문에 현재 공식 CPML 상업용 등급은 판매되지 않습니다 — 현재 XTTS v2에 대한 유료 상업용 라이선스를 발급하는 주체가 없으므로, "CPML 비상업용"이 유일하게 이용 가능한 상태입니다.
📍 한 문장으로
Coqui Public Model License(CPML)는 XTTS v2 모델 가중치에 대한 Coqui AI의 자체 비상업용 라이선스입니다 — 개인, 연구, 학술 용도는 허용하지만 상업적 이용은 금지하며, 현재 공식 상업용 라이선스는 판매되지 않습니다.
💬 쉽게 말하면
CPML은 Coqui TTS 툴킷의 MPL 2.0 코드 라이선스와는 별개의 라이선스이며 — XTTS v2 모델 가중치와 그 오디오 출력에 특정하여 적용됩니다. 수익을 창출하는 용도로 XTTS v2를 사용하기 전에 CPML 전문을 직접 읽으십시오.
- 정식 명칭: Coqui Public Model License(CPML) — Coqui AI가 XTTS v2 모델 가중치를 위해 특별히 작성한 소스 공개형 비상업용 라이선스.
- 상업적 사용, 공식 상태: 허용되지 않음. CPML 문서는 상업적 이용을 명시적으로 제한하며, 현재 공식 상업용 라이선스는 판매되지 않습니다 — Coqui Inc는 2024년 1월에 문을 닫았습니다.
- CPML의 비상업용 범위: 개인 사용, 연구, 학술 작업은 허용되며 생성된 오디오 출력의 사용도 포함됩니다 — 단, 해당 배포에서 수익이 발생하지 않는 경우에 한합니다.
- 오픈소스가 아님: Open Source Initiative(OSI)는 CPML을 승인하지 않았습니다. 모델 가중치가 공개적으로 다운로드 가능하더라도, 이는 오픈소스가 아닌 소스 공개형입니다.
- 모델 가중치에 적용되며 툴킷에는 적용되지 않음: CPML은 XTTS v2 모델 파일 자체를 규정합니다. 이를 둘러싼 Coqui TTS 툴킷 코드는 별도로 MPL 2.0 하에 라이선스되어 있으며, 수정 사항 공개를 조건으로 상업적 이용이 허용됩니다.
⚠️Warning: 이는 사실 참고 자료이며 법률 자문이 아닙니다. 상업적 결정을 위해 이 요약에 의존하기 전에 공식 CPML 전문을 직접 읽고 변호사와 상담하십시오.
CPML 비대화형 수락 (COQUI_TOS_AGREED)
CPML의 적용을 받는 XTTS / Coqui 모델을 처음 로드하면, 라이브러리가 라이선스 조건을 출력하고 수락을 위해 "y" 입력을 기다립니다. 이 대화형 프롬프트는 Docker 빌드, CI 파이프라인, 헤드리스 서버에서 멈춥니다. CPML을 비대화형으로 수락하려면 COQUI_TOS_AGREED 환경 변수를 1로 설정하십시오 — 이는 모델이 로드되기 전에 Coqui Public Model License를 읽고 동의했음을 기록합니다. 이것은 라이선스를 변경하지 않습니다. CPML은 여전히 비상업용이며, 이 변수를 설정하는 것은 그 조건에 대한 동의이지 면제가 아닙니다.
📍 한 문장으로
환경 변수 COQUI_TOS_AGREED=1을 설정하여 Docker, CI 또는 헤드리스 환경에서 대화형 프롬프트 없이 Coqui Public Model License(CPML)를 수락합니다.
💬 쉽게 말하면
셸이나 Dockerfile에서는 export COQUI_TOS_AGREED=1을 사용하고, Python에서는 모델을 가져오거나 로드하기 전에 `os.environ["COQUI_TOS_AGREED"] = "1"`을 설정하십시오. 어느 쪽이든 모델이 키보드 입력을 기다리지 않고 로드됩니다.
- 셸 / CI: 스크립트를 실행하기 전에
export COQUI_TOS_AGREED=1. - Docker: Dockerfile에
ENV COQUI_TOS_AGREED=1을 추가하거나docker run에-e COQUI_TOS_AGREED=1을 전달하십시오. - Python(모델 로드 전에 설정): `import os; os.environ["COQUI_TOS_AGREED"] = "1"
—TTS(...)`가 XTTS 모델을 인스턴스화하기 전에 실행되어야 합니다. - 기능: CPML의 비대화형 수락을 기록하여 모델 로드가
y/n프롬프트에서 멈추지 않도록 합니다. 상업용 라이선스가 아니며 비상업용 제한을 제거하지 않습니다.
# 1) Shell / CI — accept the CPML once for the session
export COQUI_TOS_AGREED=1
# 2) Dockerfile — bake acceptance into the image
# ENV COQUI_TOS_AGREED=1
# 3) Python — set it before the model is created
import os
os.environ["COQUI_TOS_AGREED"] = "1" # must be set BEFORE the TTS() call below
from TTS.api import TTS
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to("cuda")
# Model now loads without the interactive license prompt⚠️Warning: COQUI_TOS_AGREED=1은 대화형 프롬프트만 억제합니다 — 이는 비상업용 라이선스로 남아 있는 CPML에 대한 동의입니다. XTTS v2에 대한 상업적 권리를 부여하지 않습니다.
로컬 TTS vs ElevenLabs 및 클라우드 TTS
ElevenLabs, Google Text-to-Speech, Azure Speech는 2026년 TTS의 품질 상한선으로 남아 있습니다.
- 품질 상한선: ElevenLabs > StyleTTS 2 ≈ XTTS v2 > F5-TTS ≈ Coqui TTS > Piper.
- 지연 시간: 로컬 Piper(첫 오디오 ~30~50 ms)는 ElevenLabs API 왕복(~300~500 ms)보다 빠릅니다.
- 비용: ElevenLabs는 월 $5~99 요금을 청구합니다. 로컬 TTS는 초기 하드웨어 이후 $0입니다.
- 프라이버시: 로컬 TTS = 오디오 데이터가 어디에도 전송되지 않음. 민감한 콘텐츠에 필수적입니다.
- 오프라인 기능: 로컬 = 완전 오프라인. ElevenLabs = 인터넷 필요.
- 클라우드를 사용할 때: 전문 음성 제작, 최고 품질이 필요한 고객 대면 제품.
- 로컬을 사용할 때: 프라이버시 중요 오디오, 임베디드 장치, 비용에 민감한 배치 처리, 오프라인 환경.
선택 방법
요구 사항에서 올바른 TTS 엔진까지의 결정 다이어그램:
📍 한 문장으로
음성 복제가 필요합니까? → XTTS v2(최고 품질) 또는 F5-TTS(더 빠름) 또는 Coqui TTS(오픈 라이선스). CPU 속도가 필요합니까? → Piper. 창의적 오디오가 필요합니까? → Bark. 최고의 영어 품질이 필요합니까? → StyleTTS 2.
💬 쉽게 말하면
누군가의 음성을 복제하려면 품질을 위해 XTTS v2, 더 빠른 추론을 위해 F5-TTS, 허용적 라이선스를 위해 Coqui VITS를 사용하십시오. Raspberry Pi용 음성 인터페이스를 구축하는 경우 Piper를 사용하십시오. 음향 효과가 있는 팟캐스트를 만드는 경우 Bark를 시도하십시오.
- 음성 복제가 필요합니까? → 예: XTTS v2(최고 품질, CPML) 또는 F5-TTS(더 빠름, CC-BY-NC-4.0) 또는 Coqui VITS(좋은 품질, MPL 2.0). 아니오: Piper(속도), StyleTTS 2(품질).
- CPU / Raspberry Pi 전용으로 실행해야 합니까? → Piper만. Kokoro는 더 높은 품질 CPU 대안입니다.
- 비음성 사운드가 있는 창의적 오디오가 필요합니까? → Bark.
- 최고의 영어 내레이션 품질이 필요합니까? → StyleTTS 2.
- 다국어 지원이 필요합니까? → XTTS v2(17개 언어, 다국어 복제), Coqui(20개+ 언어), Piper(20개+ 언어 패키지).
- 완전히 상업적인 MIT 라이선스가 필요합니까? → Piper, Bark 또는 StyleTTS 2.
- 음성 어시스턴트 파이프라인을 구축 중입니까? → 낮은 지연 시간 TTS 출력을 위해 Piper를 사용하십시오(/ko/power-local-llm/build-local-voice-assistant-2026 참조).
자주 묻는 질문
XTTS v2로 음성을 복제하려면 얼마나 많은 참조 오디오가 필요합니까?
XTTS v2는 최소 3초의 깨끗한 참조 오디오가 필요하지만 6초 이상이면 결과가 현저히 향상됩니다. 오디오는 배경 소음이 최소화된 단일 화자여야 합니다.
Piper TTS를 상업적 제품에 사용할 수 있습니까?
예. Piper는 MIT 라이선스로 제한 없는 상업적 사용이 허용됩니다. 음성 모델(ONNX 파일)은 음성별로 별도 라이선스가 있을 수 있으므로 배포 전 확인하십시오.
회사가 문을 닫은 후에도 Coqui TTS가 유지 관리됩니까?
예, 하지만 속도가 줄어들었습니다. Coqui 회사는 2024년 1월에 문을 닫았지만 오픈소스 저장소(coqui-ai/TTS)는 커뮤니티 기여자들이 유지 관리합니다.
어떤 로컬 TTS 엔진이 최고의 다국어 지원을 가지고 있습니까?
XTTS v2는 17개 언어를 지원하며 다국어 음성 복제가 가능합니다. Coqui TTS는 20개 이상의 언어 모델을 갖추고 있습니다. 단일 참조 샘플에서 여러 언어로 복제해야 한다면 XTTS v2가 유일한 옵션입니다.
Bark가 음악을 생성할 수 있습니까?
Bark는 `[music]` 토큰으로 간단한 음악 조각을 생성할 수 있습니다. 전용 음악 생성기가 아닙니다 — 출력이 짧고 일관되지 않습니다.
음성 복제를 위한 최고의 무료 로컬 TTS는 무엇입니까?
F5-TTS(CC-BY-NC-4.0)는 비상업적 사용에 적합합니다. 상업적 사용의 경우 Coqui TTS(VITS 백엔드, MPL 2.0). XTTS v2는 최고의 품질이지만 CPML이 상업적 배포를 제한합니다.
Apple Silicon Mac에서 XTTS v2를 실행할 수 있습니까?
예, 하지만 CPU 전용 — M5 Pro에서 약 3배 실시간입니다. 현재 TTS 엔진을 위한 Metal GPU 가속이 없습니다.
어떤 로컬 TTS 엔진이 가장 인간처럼 들립니까?
영어 내레이션의 경우 StyleTTS 2 — MOS ~4.3. XTTS v2와 F5-TTS는 복제된 음성 자연스러움에서 경쟁적(~4.1). 어떤 것도 ElevenLabs Turbo v2에 필적하지 않습니다.
XTTS v2를 상업적으로 사용할 수 있습니까?
아니오, 별도의 상업용 계약 없이는 불가능합니다. XTTS v2는 Coqui Public Model License(CPML)로 배포되며, 이는 모델과 그 오디오 출력의 개인, 연구, 취미 용도는 허용하지만 상업적 사용 — 유료 제품, SaaS, 광고 지원 콘텐츠 또는 클라이언트 작업 — 은 금지합니다. Coqui Inc가 2024년 1월에 문을 닫았으므로 현재 XTTS v2 상업용 라이선스를 판매하는 주체가 없습니다. 실질적으로 XTTS v2를 비상업용으로만 취급하십시오. 상업적 음성 복제에는 Tortoise(Apache 2.0) 또는 VITS 백엔드의 Coqui TTS 툴킷(MPL 2.0)을 사용하십시오. 이는 사실 참고 자료이며 법률 자문이 아닙니다 — 배포 전에 CPML을 직접 읽으십시오.
Docker / CI에서 Coqui CPML 라이선스를 비대화형으로 수락하는 방법은?
환경 변수 COQUI_TOS_AGREED를 1로 설정하십시오. Coqui/XTTS 라이브러리는 일반적으로 CPML을 출력하고 "y" 입력을 기다리는데, 이는 Docker 빌드, CI, 헤드리스 서버에서 멈춥니다. COQUI_TOS_AGREED=1을 설정하면 수락이 기록되어 모델이 프롬프트 없이 로드됩니다. 셸이나 CI 단계에서는 export COQUI_TOS_AGREED=1, Dockerfile에서는 ENV COQUI_TOS_AGREED=1, Python에서는 TTS() 호출 전에 `os.environ["COQUI_TOS_AGREED"] = "1"`을 사용하십시오. 이는 프롬프트만 억제할 뿐입니다 — CPML에 대한 동의이며 상업적 권리를 부여하지 않습니다.
XTTS v2는 몇 개의 음성과 언어를 지원합니까?
XTTS v2에는 이름이 지정된 고정 음성 카탈로그가 없습니다 — 복제 모델이므로 6초의 참조 클립을 제공하면 해당 화자를 재현합니다(저장소에는 빠른 테스트를 위한 몇 가지 내장 화자 프리셋도 제공됩니다). 17개 언어로 음성을 생성합니다: 영어, 스페인어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 폴란드어, 터키어, 러시아어, 네덜란드어, 체코어, 아랍어, 중국어(zh-cn), 일본어, 헝가리어, 한국어, 힌디어. 복제는 다국어로 가능합니다: 음성을 한 번 복제하면 17개 언어 중 어느 것으로든 생성할 수 있습니다.
Kokoro vs Piper — 어떤 경량 CPU TTS를 사용해야 합니까?
둘 다 GPU 없이 CPU에서 빠르게 동작하며 둘 다 허용적 라이선스(Piper는 MIT, Kokoro는 Apache 2.0)이므로 어느 쪽이든 상업적 사용이 안전합니다. 가장 낮은 지연 시간과 가장 넓은 언어 범위가 필요한 경우(20개 이상의 언어 패키지, Raspberry Pi 5에서 실시간) Piper를 선택하십시오 — 임베디드 및 스마트홈 음성의 표준입니다. Piper보다 더 자연스러운 음질을 원하고 약간 더 많은 연산을 허용할 수 있다면 Kokoro(StyleTTS 2 아키텍처 기반의 8200만 파라미터 모델)를 선택하십시오. 영어 품질이 더 무거운 GPU 엔진에 가깝습니다. Raspberry Pi 또는 항상 켜진 어시스턴트에는 Piper, 밀리초보다 품질이 더 중요한 데스크톱/서버 낭독에는 Kokoro를 사용하십시오.
XTTS v2는 리투아니아어를 지원합니까?
아니요. XTTS v2는 정확히 17개 언어를 지원합니다: 영어, 스페인어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 폴란드어, 터키어, 러시아어, 네덜란드어, 체코어, 아랍어, 중국어(zh-cn), 일본어, 헝가리어, 한국어, 힌디어. 리투아니아어는 이 목록에 없으며 추가에 대한 공식 로드맵도 없습니다. 리투아니아어 음성 합성이 필요하다면 Piper(MIT)의 음성 저장소에 리투아니아어 음성 팩이 있습니다 — 해당 저장소는 커뮤니티 기여로 운영되어 상황이 바뀌므로 Hugging Face의 Piper 음성 목록에서 현재 가용성을 확인하십시오.
Coqui STT는 Coqui TTS 또는 XTTS v2와 같은 것입니까?
아니요 — 서로 별개의 프로젝트입니다. Coqui STT는 Mozilla DeepSpeech를 포크한 음성 인식 엔진으로, Mozilla Public License 2.0으로 라이선스되었습니다. Coqui Inc는 2024년 1월 회사가 문을 닫기 전에 Coqui STT를 중단하고 보관 처리했으며, 이후 의미 있는 업데이트가 없었습니다. Coqui TTS(이 가이드에서 다루는 텍스트 음성 변환 툴킷, MPL 2.0)와 XTTS v2(음성 복제 모델, CPML)는 Coqui STT와 무관하며 각자의 라이선스 하에 지금도 사용할 수 있습니다. 지금 로컬 음성 인식이 필요하다면 중단된 Coqui STT 대신 Whisper.cpp 또는 faster-whisper를 사용하십시오 — 자세한 내용은 로컬 음성 인식 비교를 참고하십시오.
참고 자료
- GitHub의 Piper TTS — 소스 코드, 음성 패키지, ONNX 모델 다운로드 및 Raspberry Pi 설정 가이드.
- GitHub의 Coqui TTS — 소스 코드, 모델 목록, 음성 복제 문서 및 Python API 참조.
- XTTS v2 문서 — XTTS v2 모델 카드, 라이선스(CPML) 및 음성 복제 API.
- GitHub의 Bark — 소스 코드, 오디오 프롬프트 토큰, 모델 다운로드 및 출력 예제.
- GitHub의 StyleTTS 2 — 아키텍처 논문, 모델 체크포인트 및 추론 가이드.
- GitHub의 F5-TTS — zero-shot 음성 복제가 있는 flow-matching TTS.
- GitHub의 Kokoro TTS — Apache 2.0 라이선스의 경량 고품질 TTS, CPU에 최적화.
- GitHub의 Tortoise TTS — 음성 복제가 있는 고품질 다중 음성 TTS, Apache 2.0 라이선스. 매우 느리지만 상업적으로 친화적.
- Hugging Face의 XTTS-v2 LICENSE.txt (CPML) — XTTS v2를 규율하는 Coqui Public Model License의 전체 텍스트.
- Hugging Face의 Piper voices — 음성별 라이선스 정보와 함께 사용 가능한 모든 언어/음성 패키지.
- Piper 음성 샘플 — 지원되는 언어의 모든 Piper 음성에 대한 오디오 데모.
