Skip to main content
PromptQuorum
/고급 로컬 LLM/XTTS v2 리뷰(2026): 단 6초의 오디오로 만드는 다국어 음성 클로닝
Voice, Speech & Multimodal

XTTS v2 리뷰(2026): 단 6초의 오디오로 만드는 다국어 음성 클로닝

·읽는 시간 12분·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

XTTS v2는 Coqui가 만든 다국어 음성 클로닝 모델로, 단 6초의 참조 오디오만으로 목소리를 복제해 17개 언어로 해당 목소리의 음성을 생성합니다. Coqui TTS 툴킷을 통해 실행됩니다(pip install coqui-tts 실행 후 TTS("tts_models/multilingual/multi-dataset/xtts_v2")). 라이선스인 Coqui Public Model License(CPML)는 비상업용입니다. 회사인 Coqui AI가 2023년 12월에 유료 서비스를 종료했기 때문에, 현재 상업용 라이선스로 가는 활성화된 경로는 없습니다. 로컬 TTS 엔진 전반의 라이선스 비교는 PromptQuorum의 로컬 TTS 라이선스 가이드를 참고하세요.

XTTS v2는 Coqui가 공개한 다국어 음성 클로닝 모델로, Hugging Face에 배포되어 있으며, 단 6초의 참조 오디오만으로 목소리를 복제해 17개 언어로 말하게 할 수 있습니다. 이 모델은 Coqui TTS 툴킷을 통해 실행되며, 현재 활발히 유지 관리되는 포크는 idiap/coqui-ai-TTS입니다. 모델 가중치를 직접 사용해 독립적으로 실행할 수도 있습니다. 이 리뷰에서는 XTTS v2가 실제로 무엇을 하는지, 실제 사용 명령어, 라이선스(비상업용인 Coqui Public Model License, CPML), 그리고 이 모델이 적합한 경우와 그렇지 않은 경우를 다룹니다. 이 모델을 처음 공개한 회사 Coqui AI가 2023년 12월에 유료 서비스를 종료했기 때문입니다.

XTTS v2 리뷰(2026): 단 6초의 오디오로 만드는 다국어 음성 클로닝

핵심 요점

  • 단 6초의 참조 오디오만으로 목소리를 복제하며, 17개 언어를 지원한다.
  • Coqui TTS 툴킷(pip install coqui-tts)을 통해, 또는 Hugging Face 모델 가중치를 직접 사용해 실행할 수 있다.
  • 라이선스: Coqui Public Model License(CPML) — 비상업용에 한함.
  • 활성화된 상업용 라이선스 경로 없음: Coqui AI가 2023년 12월 유료 서비스를 종료했다.
  • 첫 오디오까지 200밀리초 미만의 스트리밍 지연 시간이 문서화되어 있다. GPU를 강력히 권장한다.
  • CPML 동의가 필요하다 — Docker나 CI에서 비대화형으로 동의하려면 COQUI_TOS_AGREED=1을 설정한다.

📍 한 문장으로

XTTS v2는 Coqui의 다국어 음성 클로닝 모델로, 6초의 참조 오디오로 목소리를 복제해 17개 언어로 말하게 할 수 있으며, 비상업용 Coqui Public Model License(CPML) 하에 라이선스되어 있고, 공개한 회사 Coqui AI가 2023년 12월 유료 서비스를 종료한 이후 활성화된 상업용 라이선스 경로가 없다.

💬 쉽게 말하면

누군가 말하는 짧은 오디오 클립을 듣고, 같은 목소리로 17개의 서로 다른 언어로 새로운 문장을 생성할 수 있는 AI 모델입니다. 개인 및 연구 용도로는 무료지만, 현재 존재하지 않는 별도 계약 없이는 유료 제품에 사용할 수 없습니다.

📌참고: CPML은 XTTS v2를 실행하는 Coqui TTS 툴킷과 동일한 라이선스가 아닙니다 — 툴킷 자체는 MPL-2.0이지만, 이 특정 모델의 가중치와 출력물은 비상업용입니다. 자세한 내용은 아래 라이선스와 상업적 사용 섹션을 참고하세요.

XTTS v2가 실제로 하는 일

XTTS v2는 GPT 기반의 언어 간 음성 클로닝 텍스트 음성 변환 모델입니다. 짧은 참조 오디오 클립과 목표 텍스트가 주어지면, 참조 오디오와 다른 언어일지라도 복제된 목소리로 음성을 생성합니다.

  • 몇 초 만에 완료되는 음성 클로닝. Coqui의 공식 모델 카드에 따르면, 단 하나의 6초짜리 참조 오디오 클립만으로 목소리를 복제할 수 있으며, 새로운 목소리를 위한 미세 조정이나 학습 과정이 필요하지 않다.
  • 언어 간 클로닝을 지원하는 17개 언어. 지원 언어는 영어, 스페인어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 폴란드어, 터키어, 러시아어, 네덜란드어, 체코어, 아랍어, 중국어(zh-cn), 일본어, 헝가리어, 한국어, 힌디어이다 — 영어 오디오로 목소리를 복제한 뒤, 동일한 복제 목소리로 나머지 16개 언어 중 어느 것으로든 음성을 생성할 수 있다.
  • 스트리밍 추론. XTTS v2는 첫 오디오까지 200밀리초 미만의 지연 시간으로 스트리밍 합성을 지원하며, 이 기능은 Coqui TTS v0.20.0에 도입된 이래 문서화되어 있다 — 완전한 오디오 파일 렌더링을 기다리기에는 너무 느린 대화형 음성 애플리케이션에 유용하다.
  • Coqui TTS 툴킷을 통한 실행. XTTS v2를 실행하는 주요하고 지원되는 방법은 Coqui TTS(pip install coqui-tts)를 통하는 것이며, 이는 TTS("tts_models/multilingual/multi-dataset/xtts_v2")로 노출된다.
  • 화자 임베딩 재사용. 매번 원본 참조 클립을 전달하는 것 외에도, 이 툴킷은 화자의 잠재 임베딩을 계산하고 재사용하는 것을 지원해, 동일한 복제 목소리로 반복 합성할 때 재계산을 피할 수 있다.

실제 사용 예시

이 명령어들은 Coqui TTS 툴킷의 문서화된 Python API를 사용하며, 이는 XTTS v2를 실행하는 주요하고 지원되는 방법입니다.

  • 참조 오디오 품질이 중요합니다. 배경 소음이나 음악이 없는 단일 화자의 깨끗한 6초 클립은 짧거나, 시끄럽거나, 여러 화자가 섞인 클립보다 눈에 띄게 더 나은 클론을 만들어낸다.
  • 비대화형 CPML 동의는 무인 환경(Docker, CI)에서 XTTS v2가 처음 로드될 때 필요합니다 — 첫 로드 전에 COQUI_TOS_AGREED=1을 설정하세요.
python
# 툴킷 설치
pip install coqui-tts

# CPML을 비대화형으로 동의(Docker/CI에서 필수; 그렇지 않으면
# 첫 로드 시 대화형 프롬프트가 나타남)
export COQUI_TOS_AGREED=1

# Python API: 목소리 복제 및 음성 생성
import torch
from TTS.api import TTS

device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)

# 동일 언어 클로닝
tts.tts_to_file(
    text="This is a cloned voice speaking a new sentence.",
    speaker_wav="reference_voice.wav",
    language="en",
    file_path="output_en.wav",
)

# 언어 간 클로닝: 영어 오디오로 복제 후 스페인어로 말하기
tts.tts_to_file(
    text="Esta es la misma voz clonada, ahora hablando en español.",
    speaker_wav="reference_voice.wav",
    language="es",
    file_path="output_es.wav",
)

# 스트리밍 합성(첫 오디오까지 낮은 지연 시간)
for chunk in tts.tts_stream(
    text="Streaming audio, chunk by chunk, for interactive use.",
    speaker_wav="reference_voice.wav",
    language="en",
):
    play_audio(chunk)

라이선스와 상업적 사용

XTTS v2의 모델 가중치와 생성된 오디오 출력물은 Coqui Public Model License(CPML) 1.0.0 하에 라이선스되어 있습니다. 이는 Hugging Face에서 모델과 함께 공개된 라이선스 파일을 통해 확인되었습니다. CPML은 "머신러닝 모델과 그 출력물의 비상업적 사용만을 허용한다"고 명시하고 있습니다 — 허용되는 용도에는 개인 프로젝트, 학술 연구, 취미 작업이 포함되며, 해당 사용과 관련해 직접적이든 간접적이든 보수를 받지 않는다는 조건이 붙습니다.

현재 XTTS v2에는 활성화된 상업용 라이선스 경로가 없습니다. 모델 카드에는 상업용 라이선스 문의를 위한 연락처로 info@coqui.ai가 기재되어 있지만, 회사인 Coqui AI는 2023년 12월 유료 서비스를 종료했습니다 — PromptQuorum은 이 주소가 현재 실제로 관리되고 있는지, 혹은 오늘날 상업용 라이선스를 실제로 얻을 수 있는지 확인할 수 없었습니다. 유료 제품을 출시하기 전에 독립적으로 다른 확인을 하지 않는 한, XTTS v2를 오직 비상업용으로만 취급하세요.

CPML은 XTTS v2의 모델 가중치와 그 출력물에만 구체적으로 적용되며, 모델을 실행하는 Coqui TTS 툴킷 코드에는 적용되지 않습니다. 툴킷은 별도로 MPL-2.0 하에 라이선스되어 있으며, 툴킷 수정에 대한 소스 공개 조건과 함께 상업적 사용을 실제로 허용합니다. 이 단락은 라이선스의 대략적인 형태를 설명한 것일 뿐이며 법률 자문이 아닙니다 — 상업적 배포 전에 직접 CPML을 읽고 변호사와 상담하세요.

XTTS v2는 어떤 라이선스를 사용하나요?

XTTS v2는 Coqui Public Model License(CPML) 1.0.0 하에 공개되어 있으며, 이는 모델 가중치와 생성된 오디오 출력물에 적용되는 비상업용 라이선스입니다. 개인, 연구, 취미 용도는 허용되지만, 유료 제품, SaaS 도구, 클라이언트 납품물 등 상업적 사용은 별도 계약 없이는 금지됩니다. 이는 법률 자문이 아닙니다. 상업적으로 사용하기 전에 직접 CPML을 읽으세요.

XTTS v2가 적합하지 않은 경우

XTTS v2는 고품질 음성 클로닝 모델이지, 상업적으로 배포 가능한 범용 TTS 엔진이 아닙니다. 다음과 같은 상황에는 적합하지 않은 도구입니다.

  • 확인된 라이선스가 없는 모든 상업용 제품. CPML은 비상업용이며, 2023년 Coqui AI가 폐업한 이후 확인되고 활성화된 상업용 라이선스 경로는 현재 존재하지 않는다. 라이선스 조건을 먼저 독립적으로 확인하지 않은 채 유료 제품, 광고 기반 앱, 클라이언트 납품물에 XTTS v2를 출시하지 마세요.
  • CPU만 사용하는, 리소스가 제한된 실시간 사용. XTTS v2는 저지연 스트리밍을 지원하지만, 그 성능은 GPU 가속을 전제로 합니다. CPU만 사용할 경우 Piper 같은 경량 엔진보다 눈에 띄게 느리며, Raspberry Pi 같은 보급형 하드웨어에서의 실시간 사용에는 실용적이지 않을 수 있습니다.
  • 매우 짧거나 시끄러운 오디오로부터의 음성 클로닝. 6초가 문서화된 최소 요구치이긴 하지만, 시끄럽거나 압축되었거나 여러 화자가 섞인 참조 클립은 깨끗한 단일 화자 녹음보다 눈에 띄게 나쁜 클론을 만들어냅니다.
  • 지원되는 17개 언어 이외의 언어. XTTS v2는 정확히 영어, 스페인어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 폴란드어, 터키어, 러시아어, 네덜란드어, 체코어, 아랍어, 중국어(zh-cn), 일본어, 헝가리어, 한국어, 힌디어만 지원하며, 본 게시물 발행 시점 기준으로 추가 언어에 대한 공식 로드맵은 없습니다.
  • 동의 없이 누군가를 사칭하는 것. 실제 인물의 목소리를 본인의 인지나 동의 없이 복제하는 것은 CPML의 비상업용 제한과는 별개로 동의, 퍼블리시티권, 그리고 잠재적으로 사기나 사칭과 관련된 문제를 야기합니다 — 이는 라이선스 조건과 무관하게, 개인 및 상업적 사용 모두에 동일하게 적용됩니다.

XTTS v2의 대안

Piper

최적 용도:
가장 빠른 CPU 전용 합성, 음성 클로닝 없음, Raspberry Pi에서 실시간 실행
라이선스:
GPL-3.0-or-later

Coqui TTS 툴킷

최적 용도:
XTTS v2(및 다른 모델)를 실행하는, 더 넓고 관대한 라이선스의 코드베이스를 가진 소프트웨어
라이선스:
MPL-2.0(툴킷에만 적용)

Bark

최적 용도:
표현력이 풍부한 비언어 오디오 — 웃음, 한숨, 주변 소리
라이선스:
MIT

StyleTTS 2

최적 용도:
가장 자연스러운 영어 내레이션 품질(음성 클로닝 없음)
라이선스:
MIT

ElevenLabs

최적 용도:
상업용 음성 클로닝과 명확한 상업용 라이선스를 갖춘 관리형 클라우드 API
라이선스:
독점(유료 클라우드 API)

자주 묻는 질문

XTTS v2란 무엇인가요?

XTTS v2는 Coqui가 공개한 다국어 음성 클로닝 텍스트 음성 변환 모델로, 단 6초의 참조 오디오만으로 목소리를 복제해 언어 간 클로닝을 포함한 17개 언어로 해당 목소리의 음성을 생성합니다.

XTTS v2를 상업적으로 사용할 수 있나요?

별도의 계약 없이는 불가능합니다. XTTS v2는 Coqui Public Model License(CPML) 하에 라이선스되어 있으며, 개인, 연구, 취미 용도는 허용되지만 유료 제품, SaaS, 광고 기반 콘텐츠, 클라이언트 작업 등 상업적 사용은 금지됩니다. 이를 공개한 회사 Coqui AI는 2023년 12월 유료 서비스를 종료했으며, PromptQuorum은 오늘날 활성화된 상업용 라이선스 경로가 존재하는지 확인할 수 없었습니다. XTTS v2를 오직 비상업용으로만 취급하세요.

XTTS v2가 목소리를 복제하는 데 필요한 참조 오디오는 얼마나 되나요?

공식 Hugging Face 모델 카드에 따르면 깨끗한 단일 화자 참조 오디오 단 6초면 충분합니다. 더 길고 깨끗한 클립일수록 일반적으로 더 정확한 클론을 만들어냅니다.

XTTS v2는 몇 개의 언어를 지원하나요?

정확히 17개입니다: 영어, 스페인어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 폴란드어, 터키어, 러시아어, 네덜란드어, 체코어, 아랍어, 중국어(zh-cn), 일본어, 헝가리어, 한국어, 힌디어. 이 언어들 중 하나로 된 오디오로 목소리를 복제한 뒤 나머지 언어 중 어느 것으로든 음성을 생성하는 언어 간 클로닝을 지원합니다.

XTTS v2는 어떻게 실행하나요?

pip install coqui-tts로 Coqui TTS 툴킷을 설치한 다음, TTS("tts_models/multilingual/multi-dataset/xtts_v2")로 모델을 로드하세요. Docker 컨테이너나 CI 파이프라인처럼 CPML 라이선스를 비대화형으로 동의해야 한다면, 먼저 환경 변수 COQUI_TOS_AGREED=1을 설정하세요.

XTTS v2를 실행하려면 GPU가 필요한가요?

GPU를 강력히 권장합니다. XTTS v2는 CPU에서도 실행되지만 눈에 띄게 느려집니다 — 문서화된 200밀리초 미만의 스트리밍 지연 시간은 GPU 가속을 전제로 하며, CPU만 사용하는 것은 실시간 애플리케이션에는 실용적이지 않습니다.

XTTS v2와 Coqui TTS 툴킷의 차이는 무엇인가요?

XTTS v2는 비상업용 CPML 하에 라이선스된 특정 음성 클로닝 모델입니다. Coqui TTS 툴킷은 XTTS v2와 다른 모델들을 실행하는 소프트웨어(Python 패키지와 CLI)로, 별도로 MPL-2.0 하에 라이선스되어 있으며 이는 툴킷 코드 자체의 상업적 사용을 실제로 허용합니다.

결론

XTTS v2는 2026년 기준으로도 이용 가능한 가장 높은 품질의 로컬 음성 클로닝 모델 중 하나로 남아 있으며, 6초 클로닝 요구 조건, 17개 언어에 걸친 언어 간 지원, 200밀리초 미만의 스트리밍 지연 시간의 조합은 개인, 연구, 프로토타이핑 용도로 진정으로 뛰어난 성능을 보여줍니다. 대부분의 독자에게 실제로 중요한 결정 요소는 라이선스입니다. Coqui Public Model License는 명백히 비상업용이며, Coqui AI가 2023년 12월에 폐업했기 때문에 오늘날 확인되고 활성화된 상업용 라이선스 경로는 존재하지 않습니다. 사용 목적이 개인, 학술, 또는 비상업용 프로토타입이라면 XTTS v2는 강력하고 문서화가 잘 된 선택지입니다. 상업용 음성 클로닝이 필요하다면, 그 위에 무언가를 구축하기 전에 독립적으로 라이선스 조건을 확인하거나, 관대한 라이선스의 대안으로 PromptQuorum의 PiperBark 리뷰, 또는 관리형 상업용 옵션으로 ElevenLabs 비교를 함께 참고하세요.

출처

← 고급 로컬 LLM으로 돌아가기