Skip to main content
PromptQuorum
/고급 로컬 LLM/NVIDIA GPU 환경을 위한 최고의 로컬 TTS 엔진(2026)
Voice, Speech & Multimodal

NVIDIA GPU 환경을 위한 최고의 로컬 TTS 엔진(2026)

·13분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

NVIDIA GPU가 있다면, 음성 클로닝에는 XTTS v2가, 실시간 대화형 클로닝에는 Chatterbox가, 비언어적 표현력 오디오에는 Bark가 최고의 로컬 TTS 엔진입니다. 요구 사항이 단순하다면 GPU를 거의 필요로 하지 않는 Kokoro가 여전히 올바른 선택입니다. GPU 지향 세 엔진(XTTS v2, Chatterbox, Bark)은 모두 CPU에서도 실행되지만 눈에 띄게 느려집니다. CUDA 가속이 있어야 실시간이나 배치 처리에서 실용적으로 사용할 수 있습니다. 어떤 것을 설치할지는 음성 클로닝이 필요한지, VRAM 여유가 얼마나 되는지, 라이선스가 상업 프로젝트에 맞는지에 따라 달라집니다.

이미 NVIDIA GPU를 보유하고 있다면, 실행할 가치가 있는 로컬 텍스트 음성 변환 엔진은 대부분의 가이드가 기본으로 제시하는 CPU 전용 선택지와는 다릅니다. XTTS v2, Chatterbox, Bark는 모두 CPU 속도를 음성 클로닝 품질과 표현력으로 맞바꾸며, 이는 CUDA 가속을 사용할 수 있을 때에야 비로소 의미가 있습니다. Kokoro는 여기서 의도적으로 대비 사례로 다룹니다. GPU를 보유하고 있다고 해서 자동으로 가장 무거운 모델이 필요한 것은 아니기 때문입니다. 이 가이드는 VRAM 요구 사항, 각 엔진이 CUDA로부터 실제로 얻는 이점, 음성 클로닝 기능, 라이선스를 기준으로 네 가지 모델을 비교하여, 가장 화려한 데모 영상을 가진 엔진이 아니라 여러분의 하드웨어와 실제 사용 사례에 맞는 엔진을 선택할 수 있도록 돕습니다.

NVIDIA GPU 환경을 위한 최고의 로컬 TTS 엔진(2026)

핵심 요점

  • XTTS v2: 최고의 클로닝 품질(6초 참조 클립, 17개 언어), 4-6GB VRAM 권장, 비상업용 CPML 라이선스.
  • Chatterbox: 실시간 대화형 클로닝, 약 0.5B 파라미터의 소형 모델, MIT 라이선스(상업적 사용 가능).
  • Bark: 비언어적 표현력 사운드, 음성 클로닝 없음, 네 엔진 중 가장 큰 VRAM 사용량, MIT 라이선스, 불확실한 유지 관리.
  • Kokoro: 8200만 파라미터, Apache 2.0, CPU만으로도 잘 실행됨 — GPU가 필수가 아님을 보여 주는 대비 사례.
  • GPU 지향 세 엔진은 CPU에서도 실행되지만 실제 속도 손실을 동반합니다 — 이 차이야말로 이 용도로 GPU를 보유하는 근본적인 이유입니다.
  • 음성 클로닝은 사용하는 엔진이나 라이선스와 무관하게 복제 대상 본인의 동의를 필요로 합니다.

📍 한 문장으로

NVIDIA GPU에서 XTTS v2는 최고의 음성 클로닝 품질을 제공하고, Chatterbox는 상업적으로 사용 가능한 MIT 라이선스 아래 최고의 실시간 대화형 클로닝을 제공하며, Bark는 가장 표현력이 풍부한 비언어적 오디오를 제공하고, GPU가 실제로 필요하지 않은 경우에는 Kokoro가 여전히 올바른 선택입니다.

💬 쉽게 말하면

AI 워크로드를 실행할 수 있는 그래픽 카드를 보유하고 있다면, 세 가지 텍스트 음성 변환 엔진(XTTS v2, Chatterbox, Bark)은 그 덕분에 실제로 더 빠르고 좋아지지만, 네 번째(Kokoro)는 GPU를 거의 필요로 하지 않습니다. 어떤 것을 설치할지는 음성 클로닝이 필요한지, 비디오 메모리가 얼마나 있는지, 상업적으로 사용할 계획인지에 따라 달라집니다.

📌참고: 이 가이드는 이미 NVIDIA GPU를 보유하고 있으며 그 위에서 무엇을 실행할지 결정하는 상황을 전제로 합니다. CPU 전용 환경(전용 GPU가 없는 Raspberry Pi 등)의 경우 Piper가 표준 선택지입니다 — 모든 로컬 TTS 엔진에 대한 PromptQuorum의 완전한 라이선스 및 VRAM 비교는 관련 읽을거리에 링크되어 있습니다.

실제로 GPU가 필요한 엔진은 무엇인가

XTTS v2, Chatterbox, Bark는 모두 CPU에서 실행되지만, 실시간 또는 배치 사용을 실용적으로 만드는 것은 GPU입니다 — Kokoro는 예외로, 8200만 개 파라미터 덕분에 CPU만으로도 빠르게 동작합니다. 더 무거운 세 엔진에는 공통점이 있습니다. 클로닝 또는 생성 품질을 우선시하는 모델로, 아키텍처가 연산력을 표현력과 맞바꾸므로 CUDA 가속은 미미한 속도 향상이 아니라 병목 자체를 제거합니다.

음성 클로닝, 비언어적 표현력 오디오, 또는 생성 속도가 중요한 워크로드—배치 내레이션 작업, 인터랙티브 음성 애플리케이션, 다수의 클립을 생성하는 파이프라인 등—라면 GPU 지향 엔진(XTTS v2, Chatterbox, Bark)을 사용하세요. 클로닝이 필요 없는 단순한 텍스트 내레이션만 필요하다면 TTS에 GPU VRAM을 소비하지 마세요. Kokoro나 Piper는 CPU만으로 이런 경우를 처리하며, 병렬로 실행되는 LLM 등 다른 워크로드를 위해 VRAM을 확보해 줍니다.

  • XTTS v2는 CPU에서도 실행되지만 그곳에서는 눈에 띄게 느려진다고 문서화되어 있습니다 — 200밀리초 미만의 스트리밍 지연 시간은 GPU 가속 시의 수치이지 CPU 수치가 아닙니다.
  • Chatterbox는 Resemble AI 자체 문서에 따르면 8코어 CPU에서 실시간보다 빠르게 실행된다는 CPU 대응 Nano 변형(1억 1000만 파라미터)을 제공하지만, 더 크고 클로닝에 중점을 둔 변형들은 실시간 대화형 사용에서 CUDA의 혜택을 받습니다.
  • Bark는 자체 문서에서 CPU나 오래된 GPU에서의 추론이 엔터프라이즈급 GPU에서 도달하는 거의 실시간 수준의 속도보다 상당히 느릴 수 있다고 명시적으로 밝히고 있습니다.
  • Kokoro는 예외입니다. 8200만 개 파라미터로 자체 Hugging Face 모델 카드에 따르면 CPU만으로도 실시간 또는 그 이상의 속도로 실행되며, 대용량 배치 생성을 위한 추가 여유가 필요할 때만 GPU가 필요합니다.

XTTS v2: 최고의 음성 클로닝 품질

Coqui가 공개하고 Coqui TTS 툴킷을 통해 실행되는 XTTS v2는, 짧은 참조 클립으로부터 달성 가능한 최고 품질을 필요로 하는 GPU 보유자에게 최고의 로컬 음성 클로닝 옵션입니다. 단 6초의 참조 오디오만으로 목소리를 복제하고 17개 언어로 다시 말하게 할 수 있으며, 크로스 언어 클로닝—영어 오디오에서 목소리를 복제한 뒤 스페인어나 일본어로 말하게 하는 것—도 포함됩니다.

VRAM 측면에서 XTTS v2의 모델 가중치는 약 2GB이지만, 실행을 위한 실질적인 최소치는 4GB이며 실시간 추론에는 4-6GB가 권장됩니다. 자세한 내용은 PromptQuorum의 XTTS v2 리뷰를 참고하세요. 대부분의 독자에게 결정적인 요소는 라이선스입니다. Coqui Public Model License(CPML)는 명시적으로 비상업용이며, 이 회사인 Coqui AI가 2023년 12월 유료 서비스를 종료했기 때문에 현재 확인된 활성 상업용 라이선스 경로는 없습니다.

  • XTTS v2를 사용해야 하는 경우: 프로젝트가 개인용, 학술용, 또는 비상업적 프로토타입이며 로컬에서 얻을 수 있는 최고의 클로닝 품질을 원하는 경우.
  • XTTS v2를 피해야 하는 경우: 상업용 라이선스가 필요한 경우 — CPML 조건은 비상업용이며, 2023년 Coqui AI의 서비스 종료 이후 확인된 활성 상업용 라이선스 경로가 없습니다.
  • VRAM: 모델 가중치 약 2GB, 최소 4GB, 실시간 추론에는 4-6GB 권장.
  • 최적의 용도: 로컬에서 가능한 가장 충실도 높은 음성 클로닝, 17개 언어 크로스 언어 지원, 비상업용 또는 연구 용도.

Chatterbox: 최고의 실시간 클로닝

Resemble AI가 GitHub에 공개한 Chatterbox는, 완전히 자유롭고 상업적으로 사용 가능한 라이선스 아래 실시간 대화형 음성 클로닝을 원하는 GPU 보유자에게 최고의 선택지입니다. MIT 라이선스를 따르며, XTTS v2의 비상업용 CPML과 달리 별도 계약 없이 상업적 사용이 가능합니다.

Chatterbox는 여러 크기로 제공됩니다. Resemble AI 자체 문서에 따르면 8코어 CPU에서 실시간보다 빠르게 실행되는 Nano 변형(1억 1000만 파라미터), 낮은 지연 시간을 위해 만들어진 Turbo 변형(3억 5000만 파라미터), 그리고 아키텍처상 Llama 3를 근간으로 언급하는 백본을 가지고 20개 이상의 언어를 지원하는 다국어 변형(약 5억 파라미터)이 있습니다. 제로샷 음성 클로닝은 참조 오디오 클립을 통해 작동합니다 — Resemble AI 자체 예시는 10초 클립을 사용하지만, README에는 XTTS v2처럼 공식 최소 길이가 명시되어 있지 않습니다.

Resemble AI의 공개 README에는 정확한 VRAM 수치가 게시되어 있지 않으므로, 다른 곳에서 본 구체적인 GB 수치는 자신의 카드에서 직접 테스트하기 전까지는 미확인 정보로 취급하세요. 문서화된 내용은 다음과 같습니다. Nano 변형은 CPU만으로도 무난하게 실행되는 반면, 더 큰 Turbo 및 다국어 변형은 GPU 가속의 저지연 생성을 위해 설계되었으며 — CUDA와 Apple Silicon(MPS)을 모두 지원합니다.

  • Chatterbox를 사용해야 하는 경우: 인터랙티브 음성 애플리케이션처럼 실시간 또는 준실시간 지연 시간으로 상업적으로 사용 가능한 음성 클로닝이 필요한 경우.
  • Chatterbox를 피해야 하는 경우: 하드웨어를 구매하기 전에 문서화되고 보장된 최소 VRAM 수치가 필요한 경우 — Resemble AI는 이를 공개하지 않았습니다.
  • VRAM: 공식적으로 공개되지 않음; 더 작은 Nano 변형은 CPU를 지원하고, Turbo 및 다국어 변형은 실시간 속도를 위해 GPU 가속을 목표로 합니다.
  • 최적의 용도: 자유로운 라이선스 아래 제로샷 대화형 음성 클로닝이 필요한 상업용 제품.
  • 모든 Chatterbox 출력에는 Resemble AI 고유의 Perth 워터마크가 포함되며, 문서에서는 MP3 압축을 거쳐도 남아 있는 인지 불가능한 신경망 워터마크로 설명합니다 — 이는 내장된 출처 신호일 뿐, 동의를 대체하지는 않습니다(아래 음성 클로닝과 동의 섹션 참조).

Bark: 최고의 비언어적 표현력 오디오

Suno가 GitHub에 공개한 Bark는, 음성 이상의 것 — 웃음, 한숨, 헐떡임, 그리고 텍스트 프롬프트만으로 생성되는 간단한 음악 — 을 원할 때 올바른 선택이며, 이 비교에서 GPU의 혜택을 가장 많이 받는 엔진입니다. 토큰 단위로 생성하는 아키텍처가 CUDA 가속 없이는 네 엔진 중 가장 느리기 때문입니다. 사용자 지정 음성 클로닝은 지원하지 않습니다. Suno 자체 문서에 따르면 "현재 사용자 지정 음성 클로닝을 지원하지 않습니다".

VRAM 측면에서 PromptQuorum의 Bark 리뷰에 따르면 전체 모델은 약 12GB를 필요로 하며, 소형 모델용 환경 변수 플래그(SUNO_USE_SMALL_MODELS)를 사용하면 이를 약 8GB로 줄일 수 있습니다 — XTTS v2의 4-6GB보다 눈에 띄게 많습니다. MIT 라이선스를 따르며 2023년 5월 1일부로 완전히 상업적으로 사용할 수 있게 되었지만, 유지 관리 상태는 실제로 해결되지 않은 문제입니다. 공개 GitHub 저장소는 2024년 4월 5일 이후 커밋이 없습니다.

  • Bark를 사용해야 하는 경우: 음성과 함께 비언어적 오디오(웃음, 한숨, 환경음)가 필요하고 8-12GB의 VRAM 여유가 있는 경우.
  • Bark를 피해야 하는 경우: 프로덕션 파이프라인에 신뢰할 수 있고 결정론적인 출력이 필요하거나, 음성 클로닝이 필요한 경우 — Bark는 이를 지원하지 않습니다.
  • VRAM: 전체 모델 기준 약 12GB, 소형 모델 플래그 사용 시 약 8GB — 여기서 비교한 네 엔진 중 가장 무겁습니다.
  • 최적의 용도: 표현력 있는 오디오 생성, 음성과 결합된 음향 효과, 프로토타이핑 및 연구 용도.

Kokoro: GPU가 과할 때

Kokoro는 여기서 대비 사례로 다룹니다. NVIDIA GPU를 보유하고 있다고 해서 모든 TTS 워크로드에 GPU가 필요한 것은 아니며, Kokoro가 그 증거입니다. 8200만 개 파라미터로 XTTS v2, Chatterbox, Bark보다 훨씬 작으며, 자체 Hugging Face 모델 카드는 CPU만으로도 실시간 또는 그 이상의 속도로 합성이 이루어진다고 문서화하고 있습니다. GPU 사용은 필수가 아니라 여유를 더해 줄 뿐입니다.

Kokoro는 Apache 2.0 라이선스를 따르며, 이는 Chatterbox의 MIT 라이선스와 마찬가지로 제한 없이 상업적 사용을 허용합니다. 음성 클로닝을 지원하지 않으므로 클로닝이 요구 사항이라면 XTTS v2나 Chatterbox를 대체할 수 없지만, 단순한 내레이션, 텍스트 읽기, 또는 클로닝이 필요 없는 앱의 음성 레이어에는 더 가볍고 단순한 선택지입니다.

  • Kokoro를 사용해야 하는 경우: 워크로드가 단순한 내레이션이나 텍스트 읽기이고, LLM이나 다른 작업을 위해 GPU의 VRAM을 비워 두고 싶거나, CPU 전용 배포가 필요한 경우.
  • Kokoro를 피해야 하는 경우: 음성 클로닝이 필요한 경우 — 지원하지 않으므로 대신 XTTS v2나 Chatterbox를 사용하세요.
  • VRAM: GPU에서 실행 시 약 2GB; 자체 모델 카드에 따르면 CPU만으로도 실시간 속도로 실행됩니다.
  • 최적의 용도: 더 무거운 클로닝 엔진이 정말로 과한 상황인 단순 내레이션 및 텍스트 읽기 사용 사례.

GPU 적합성 비교표

이 표는 원시 오디오 품질이 아니라, VRAM 요구 사항, 각 엔진이 CUDA 가속으로부터 얻는 이점, 음성 클로닝 기능, 라이선스라는 GPU 적합성 기준에 초점을 맞춰 네 엔진을 평가합니다.

📍 한 문장으로

XTTS v2는 최고 품질의 음성 클로닝에 더 적합하고, Chatterbox는 상업적인 실시간 대화형 클로닝에 더 적합하며, Bark는 비언어적 표현력 오디오에 더 적합하고, Kokoro는 클로닝이 필요 없고 해당 작업에 GPU를 사용하는 것이 낭비일 때 더 적합합니다.

엔진
VRAM(GPU)
GPU 속도 이점
음성 클로닝
라이선스
XTTS v24-6GB 권장큼 — CPU는 비실용적있음, 6초 클립/17개 언어CPML(비상업용)
Chatterbox공식 미공개실시간 사용에서 큼있음, 제로샷MIT
Bark약 8-12GB(소형/전체)네 엔진 중 가장 큼없음MIT
Kokoro약 2GB, GPU 선택 사항작음 — CPU에서도 빠름없음Apache 2.0

실제로 필요한 VRAM은 얼마인가

6GB 이상의 VRAM을 가진 GPU는 이 비교의 모든 엔진을 여유롭게 커버하며, 예외는 약 12GB(소형 모델 플래그 사용 시 약 8GB)가 필요한 Bark의 전체 모델뿐입니다. 기본적으로 가장 무거운 옵션에 맞춰 구매하기보다는 실제로 필요한 엔진에 맞춰 카드를 선택하세요.

TTS에 국한되지 않은 로컬 AI 워크로드 전반에 대한 VRAM 등급별 GPU 선택 일반 가이드는 PromptQuorum의 로컬 LLM용 GPU 구매 가이드를 참고하세요 — 동일한 VRAM 우선 구매 논리가 TTS에도 적용되며, 이미 TTS와 함께 로컬 LLM을 실행하고 있다면 두 워크로드는 동일한 VRAM 풀을 두고 경쟁하게 됩니다.

  • 입문형 GPU(6-8GB VRAM): XTTS v2를 여유롭게 커버하고, Bark는 소형 모델 플래그를 사용할 때만 커버하며, Kokoro와 Chatterbox의 더 작은 변형은 손쉽게 커버합니다.
  • 중급형 GPU(12GB 이상 VRAM): Bark의 전체 모델을 포함한 네 엔진 모두를 커버하며, 다른 워크로드를 위한 여유도 남습니다.
  • 로컬 LLM과 함께 TTS를 실행할 경우: 두 가지 모두를 위해 VRAM을 예산에 반영하세요 — Q4 양자화된 7B LLM만으로도 약 4-5GB가 필요하므로, 카드가 16GB 이상이 아닌 한 Bark의 전체 모델 대신 XTTS v2나 Kokoro와 조합하세요.
  • 확신이 서지 않는다면 Kokoro나 XTTS v2로 시작하세요 — 둘 다 6GB VRAM 안에 여유롭게 들어가며, 사용 사례가 커질 경우 나중에 더 무거운 엔진을 추가할 여지를 남깁니다.

자주 묻는 질문

로컬 TTS 엔진을 실행하려면 NVIDIA GPU가 필요한가요?

아니요. Kokoro는 CPU만으로도 실시간 속도로 실행되며, XTTS v2, Chatterbox, Bark 역시 CPU에서 실행됩니다 — 다만 눈에 띄게 느려질 뿐입니다. GPU는 이 세 엔진을 실시간이나 배치 사용에서 실용적으로 만들어 주는 요소이지, 애초에 실행하기 위한 엄격한 필수 조건은 아닙니다.

어떤 로컬 TTS 엔진이 최고의 음성 클로닝을 제공하나요?

Coqui가 공개한 XTTS v2는 여기서 다룬 것 중 가장 품질이 높은 음성 클로닝 옵션입니다 — 단 6초의 참조 오디오만으로 17개 언어에 걸쳐 목소리를 복제합니다. 라이선스인 Coqui Public Model License(CPML)는 비상업용입니다. Resemble AI가 MIT 라이선스로 공개한 Chatterbox는 실시간 대화 지연 시간으로 상업적으로 사용 가능한 클로닝이 필요할 때 최선의 선택입니다.

XTTS v2는 VRAM이 얼마나 필요한가요?

XTTS v2의 모델 가중치는 약 2GB이며, 실행을 위한 실질적인 최소치는 4GB이고, 실시간 추론에는 4-6GB가 권장됩니다. 자세한 내용은 PromptQuorum의 XTTS v2 전용 리뷰를 참고하세요.

Bark는 VRAM이 얼마나 필요한가요?

Bark의 전체 모델은 약 12GB의 VRAM이 필요합니다. SUNO_USE_SMALL_MODELS 환경 변수 플래그를 설정하면 이를 약 8GB로 줄일 수 있습니다. 이 가이드에서 비교한 네 엔진 중 가장 무겁습니다.

Chatterbox를 상업적으로 사용할 수 있나요?

네. Resemble AI가 공개한 Chatterbox는 MIT 라이선스를 따르며, 별도 계약 없이 상업적 사용이 가능합니다 — XTTS v2의 비상업용 CPML 라이선스와는 다릅니다.

로컬 TTS에 GPU는 과한가요?

사용 사례에 따라 다릅니다. 음성 클로닝 없이 단순한 내레이션이나 텍스트 읽기만 필요하다면, Kokoro(8200만 파라미터, Apache 2.0)는 CPU만으로도 실시간 속도로 실행되므로 이를 위해 GPU를 구매하거나 전용으로 할당할 필요는 없습니다. 음성 클로닝이나 비언어적 표현력 오디오가 필요하다면, GPU는 XTTS v2, Chatterbox, Bark를 눈에 띄게 개선합니다.

XTTS v2와 Chatterbox의 차이는 무엇인가요?

XTTS v2는 일반적으로 더 충실도 높은 클론을 생성하고 크로스 언어 클로닝을 포함해 17개 언어를 지원하지만, CPML 라이선스는 비상업용입니다. Chatterbox는 실시간 대화 지연 시간을 위해 만들어진 더 작은 모델(다국어 변형 기준 약 5억 파라미터)이며, MIT 라이선스는 상업적 사용을 허용합니다.

Bark는 음성 클로닝을 지원하나요?

아니요. Suno 자체 문서에 따르면 Bark는 "현재 사용자 지정 음성 클로닝을 지원하지 않습니다". 선택 가능한 화자 프리셋으로 웃음, 한숨, 간단한 음악 같은 표현력 있는 오디오를 생성할 수는 있지만, XTTS v2나 Chatterbox처럼 참조 녹음으로부터 임의의 인물 목소리를 클로닝할 수는 없습니다.

동일한 GPU에서 TTS와 로컬 LLM을 함께 실행할 수 있나요?

네, 두 가지 모두를 위해 VRAM을 예산에 반영한다면 가능합니다. Q4 양자화된 7B LLM만으로도 약 4-5GB가 필요하므로, XTTS v2(4-6GB)나 Kokoro(약 2GB)와 조합하면 12GB 카드에 여유롭게 들어갑니다. LLM을 Bark의 전체 모델(약 12GB)과 조합할 경우 일반적으로 합계 16GB 이상의 VRAM이 필요합니다.

개인 프로젝트라도 누군가의 목소리를 클로닝하려면 동의가 필요한가요?

네. 실제 인물의 목소리를 명시적이고 문서화된 동의 없이 클로닝하는 것은, 프로젝트가 개인용이든 상업용이든, 사용하는 엔진의 라이선스와 무관하게 동의 및 퍼블리시티권 문제를 야기합니다. 이는 법률 자문이 아니라 사실에 근거한 안내입니다.

결론

이미 NVIDIA GPU를 보유하고 있으며 이를 텍스트 음성 변환에 활용하고자 하는 독자에게는, 오디오가 무엇을 해야 하는지에 따라 선택이 달라집니다. 비상업용 CPML 라이선스를 고려할 때, 비상업적 또는 연구 목적에서 달성 가능한 최고의 음성 클로닝 품질을 원한다면 XTTS v2가 선택지입니다. 동일한 클로닝 기능을 상업 제품에 탑재해야 한다면, MIT 라이선스와 실시간 지향의 더 작은 모델 크기 덕분에 Chatterbox가 선택지입니다. 프로젝트에 비언어적 표현력 오디오—웃음, 한숨, 간단한 음악—가 필요하고 이를 위해 8-12GB의 VRAM을 투입할 수 있다면, 유지 관리 상태가 불확실하다는 점을 유의한 채로 Bark가 선택지입니다. 클로닝이 요구 사항이 아닌 한 Kokoro는 여전히 올바른 선택입니다. CPU만으로도 여유롭게 실행되므로 이를 위해 GPU VRAM을 확보해 둘 가치는 거의 없습니다. 확신이 서지 않는다면 단순 내레이션에는 Kokoro로 시작하고, 실제로 클로닝 요구 사항이 생겼을 때에만 XTTS v2나 Chatterbox로 넘어가세요 — 그렇게 하면 로컬 LLM을 포함해 함께 실행하는 다른 작업을 위해 GPU의 VRAM을 계속 확보해 둘 수 있습니다. 여기서 언급한 각 엔진의 라이선스 상세 내용은 PromptQuorum의 로컬 TTS 및 음성 클로닝 라이선스 가이드를 참고하세요.

출처

← 고급 로컬 LLM으로 돌아가기