핵심 요점
- Piper: 음성 복제 없음, 언어별 고정 음성, CPU에서 실시간 동작(Raspberry Pi 지원), GPL-3.0-or-later 라이선스.
- Chatterbox: 약 7~20초의 음성으로 제로샷 음성 복제, 5억 개 매개변수의 Llama 백본, MIT 라이선스, GPU 권장.
- Chatterbox는 감정 강도를 조절하는 exaggeration 컨트롤을 포함; Piper는 감정 제어 기능이 없음.
- Resemble AI는 Chatterbox가 블라인드 테스트에서 ElevenLabs보다 선호되었다고 보고 — 이는 모델 게시자 자체의 주장이며 PromptQuorum의 조사 결과가 아님.
- 두 프로젝트 모두 라이선스 비용이 없는 무료 오픈소스 소프트웨어.
- 추상적으로 "더 나은" 쪽이 아니라 하드웨어와 복제 필요성에 따라 선택할 것 — 둘은 서로 다른 문제를 해결함.
📍 한 문장으로
Piper는 고정된 사전 학습 음성만 제공하고 복제 기능이 없는 경량 CPU 전용 뉴럴 텍스트 음성 변환 엔진으로 현재 GPL-3.0-or-later 라이선스를 따르며, Chatterbox는 짧은 참조 클립으로 목소리를 복제하고 GPU에서 가장 잘 작동하는 Resemble AI의 MIT 라이선스 5억 개 매개변수 Llama 백본 모델입니다.
💬 쉽게 말하면
Piper는 누군가가 이미 녹음하고 학습시킨 목소리를 사용해 거의 모든 컴퓨터에서 텍스트를 빠르게 소리 내어 읽는 도구입니다. Chatterbox는 짧은 녹음에서 특정 인물의 목소리를 복사해 그 목소리로 새로운 문장을 말할 수 있는 도구이지만, 빠르게 처리하려면 더 강력한 그래픽 카드가 필요합니다.
📌참고: Piper의 라이선스는 개발이 Open Home Foundation으로 이전된 2025년에 MIT에서 GPL-3.0-or-later로 변경되었습니다. MIT를 전제로 Piper를 이전에 평가했다면, 클로즈드 소스 제품에 포함시키기 전에 다시 확인하십시오 — 아래 "라이선스와 하드웨어 비용" 섹션을 참고하세요.
각 도구가 실제로 하는 일
Piper와 Chatterbox는 모두 텍스트를 음성으로 변환하지만, 근본적으로 다른 아키텍처를 사용하며 서로 다른 문제를 해결합니다. Piper는 고정된 음성 카탈로그로 속도와 낮은 리소스 사용에 최적화되어 있고, Chatterbox는 필요할 때마다 특정 음성을 복제하는 데 최적화되어 있습니다.
- Piper: 빠르고 고정된 음성의 CPU 우선 합성. Piper는 espeak-ng로 텍스트를 음소로 변환한 후, ONNX Runtime으로 내보낸 VITS 계열 모델로 그 음소에서 파형을 합성합니다. 이 덕분에 Raspberry Pi에서도 실시간으로 동작할 만큼 빠릅니다. 각 음성은 별도로 학습되어 다운로드 가능한 모델이며, 샘플에서 새 음성을 생성하는 메커니즘은 없습니다.
- Chatterbox: Llama 기반 백본의 제로샷 음성 복제. Resemble AI가 공개한 Chatterbox는 Llama 백본으로 구축된 5억 개 매개변수 아키텍처를 사용합니다. Resemble AI 자체가 공개한 평가 방법론에 따르면 약 7~20초 정도의 짧은 참조 음성 클립만 있으면 별도의 미세 조정이나 추가 학습 없이 해당 목소리를 복제해 새로운 발화를 생성할 수 있습니다.
- Exaggeration 컨트롤(Chatterbox 전용). Chatterbox는 생성된 음성의 감정 강도를 조절하는
exaggeration매개변수(기본값 0.5)를 제공합니다. 프로젝트 자체 문서에 따르면 이 값을 높이면 발화 속도가 빨라지는 경향이 있으며,cfg(classifier-free guidance) 설정을 낮추면 더 느리고 신중한 어조로 이를 보완할 수 있습니다. - 뉴럴 워터마크(Chatterbox 전용). Chatterbox가 생성하는 모든 오디오 클립에는 Resemble AI가 설계한 지각 불가능한 Perth 워터마크가 포함되어 있으며, MP3 압축과 일반적인 오디오 편집을 견디도록 설계되어 AI 생성 음성을 사후에 식별할 수 있도록 하기 위한 것입니다.
- Piper에는 복제, 감정 제어, 워터마크 기능이 전혀 없습니다 — 이는 의도적으로 범위를 좁힌 도구로, 이러한 기능 대신 CPU 전용 속도와 훨씬 작은 리소스 사용량을 확보한 것입니다.
나란히 비교
속도와 하드웨어 비용에서는 Piper가, 음성 복제와 표현력에서는 Chatterbox가 우위입니다. 어느 쪽도 다른 쪽의 완전한 상위 호환은 아닙니다 — 아래 표는 선택의 기준이 될 구체적인 차이를 정리한 것입니다.
주요 용도
- Piper:
- CPU 전용/임베디드 하드웨어에서의 실시간 음성
- Chatterbox:
- 제로샷 음성 복제와 표현력 있는 내레이션
음성 복제
- Piper:
- 불가 — 고정된 사전 학습 음성만
- Chatterbox:
- 가능 — 약 7~20초의 참조 음성으로부터
감정 제어
- Piper:
- 없음
- Chatterbox:
- 있음 —
exaggeration매개변수
아키텍처
- Piper:
- VITS 계열, ONNX Runtime, espeak-ng 음소
- Chatterbox:
- 5억 개 매개변수의 Llama 백본
하드웨어
- Piper:
- CPU(Raspberry Pi 지원); CUDA는 선택 사항
- Chatterbox:
- 실시간에는 GPU 권장(
device="cuda")
현재 라이선스
- Piper:
- GPL-3.0-or-later
- Chatterbox:
- MIT
게시자/관리 주체
- Piper:
- Open Home Foundation
- Chatterbox:
- Resemble AI
워터마크
- Piper:
- 없음
- Chatterbox:
- 있음 — Perth 뉴럴 워터마크
실제 사용 예시
다음 명령어는 각 프로젝트 자체에서 문서화한 CLI와 Python API를 기반으로 합니다.
- Piper는 GPU 설정이 전혀 필요 없습니다 —
pip install piper-tts가 ONNX Runtime의 CPU 의존성을 자동으로 설치합니다. - Chatterbox는 CPU에서 동작(
device="cpu")하지만, 실시간 생성과 문서화된 저지연 성능은 GPU 가속을 전제로 합니다.
# ── Piper: CPU에서 설치 및 합성 ─────────────────────────────
pip install piper-tts
python3 -m piper.download_voices en_US-lessac-medium
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."
# Piper Python API
from piper import PiperVoice
voice = PiperVoice.load("en_US-lessac-medium.onnx")
with open("test.wav", "wb") as wav_file:
voice.synthesize_wav("Hello from Piper.", wav_file)
# ── Chatterbox: 설치 및 음성 복제 ──────────────────────────────
pip install chatterbox-tts
import torchaudio as ta
from chatterbox.tts import ChatterboxTTS
device = "cuda" # GPU 권장; "cpu"도 동작하지만 훨씬 느림
model = ChatterboxTTS.from_pretrained(device=device)
# 모델의 기본 음성으로 생성
wav = model.generate("This is a test.")
ta.save("output.wav", wav, model.sr)
# 짧은 참조 클립으로 제로샷 복제, exaggeration 설정 포함
AUDIO_PROMPT_PATH = "reference_voice.wav"
wav = model.generate(
"This is the cloned voice speaking a new sentence.",
audio_prompt_path=AUDIO_PROMPT_PATH,
exaggeration=0.6,
)
ta.save("output_cloned.wav", wav, model.sr)라이선스와 하드웨어 비용
Piper의 현재 관리되는 저장소인 OHF-Voice/piper1-gpl은 GPL-3.0-or-later 라이선스를 따릅니다. 이는 원래 저장소인 rhasspy/piper에서 변경된 것으로, rhasspy/piper는 2025년 10월 6일 아카이브(읽기 전용으로 전환)되기 전까지 MIT 라이선스였습니다. GPL-3.0은 카피레프트 라이선스입니다: Piper를 외부 도구로 사용하는 경우(CLI, Python 패키지, 또는 별도 프로세스로 호출되는 웹 서버) 일반적으로 사용자 자신의 애플리케이션이 GPL의 적용을 받지 않지만, Piper 자체 소스 코드를 수정한 버전을 배포하려면 그 수정 사항을 동일한 라이선스로 공개해야 합니다. 이는 법률 자문이 아닙니다 — Piper의 소스를 수정하고 재배포하는 상업적 배포를 진행하기 전에는 변호사와 상담하십시오.
Chatterbox는 MIT 라이선스를 따르며, 이는 GitHub의 resemble-ai/chatterbox에 있는 LICENSE 파일로 확인됩니다 — 저작권 표시와 라이선스 문구 유지라는 최소한의 조건으로 상업적 사용, 수정, 재배포를 허용하는 관대한 라이선스입니다.
진짜 차별화 요소는 라이선스 비용이 아니라 하드웨어 비용입니다 — 두 프로젝트 모두 무료 소프트웨어입니다. Piper는 Raspberry Pi처럼 소박한 CPU 하드웨어에서도 실시간으로 동작하므로, 이미 보유한 기기 외에 실질적인 비용은 거의 들지 않습니다. Chatterbox의 문서화된 저지연 성능은 GPU 가속(device="cuda")을 전제로 하며, 이를 제대로 활용하려면 일반적으로 소비자용 NVIDIA 카드든 대여한 클라우드 GPU 인스턴스든 CUDA를 지원하는 GPU 예산을 확보해야 합니다. CPU 전용 추론은 눈에 띄게 느리기 때문입니다.
Piper는 현재 어떤 라이선스를 사용하며, 변경된 적이 있는가?
현재 활발히 관리되는 OHF-Voice/piper1-gpl 저장소는 GPL-3.0-or-later 라이선스를 따릅니다. 원래의 rhasspy/piper 저장소는 2025년 10월 6일 아카이브되기 전까지 MIT 라이선스였습니다. 이는 상업적 사용에 실질적인 차이이므로, Piper를 클로즈드 소스 제품에 포함시키기 전에 현재 라이선스를 확인하십시오.
누가 무엇을 써야 하는가
프로젝트가 CPU 전용 또는 임베디드 하드웨어에서 동작하고 음성 복제가 필요 없다면 Piper를 사용하십시오. 짧은 참조 클립으로 특정 음성을 복제해야 하고 GPU에서 실행할 수 있다면 Chatterbox를 사용하십시오. 이 결정은 일반적인 품질 선호도가 아니라 이 두 가지 제약 조건에 달려 있습니다.
- 음성 비서와 임베디드 기기 → Piper. GPU 의존성 없이 Raspberry Pi나 유사한 저전력 하드웨어에서 실시간 성능을 내는 것이야말로 Piper가 설계된 목적이며, 이 때문에 Home Assistant 음성 파이프라인의 기본 로컬 TTS 엔진이 되었습니다.
- 접근성 도구와 스크린 리더 → Piper. 소박한 하드웨어에서 안정적이고 고정된 음성과 낮은 지연 시간이 표현력이나 복제 기능보다 여기서는 더 중요합니다.
- 특정 목소리로 하는 오디오북 내레이션이나 더빙 → Chatterbox. 짧은 참조 클립으로부터의 제로샷 복제와 템포·표현을 조절하는 exaggeration 컨트롤의 조합은 일관되고 구별 가능한 목소리가 필요한 내레이션 작업에 적합합니다.
- 개인화 또는 브랜드 음성 제품 → Chatterbox. 제품의 가치 제안이 특정한 복제된 목소리 — 내레이터, 브랜드 마스코트, 정해진 페르소나를 가진 개인 비서 — 에 의존한다면 Piper로는 이를 전혀 구현할 수 없으며, Chatterbox는 바로 이를 위해 설계되었습니다.
- 통화량이 많은 저예산 CPU 전용 서버 군 → Piper. Piper의 낮은 리소스 사용량은 GPU에 종속된 모델보다 동시 실행되는 많은 CPU 전용 인스턴스에서 더 예측 가능하게 확장됩니다.
- 확신이 서지 않는다면 Piper로 시작하십시오. GPU 의존성이 없고,
pip install piper-tts명령 하나로 설치되며, 복제 요구 사항 없이 "이 텍스트를 소리 내어 읽는" 일반적인 사례를 다룹니다. 프로젝트가 특정 목소리를 실제로 복제해야 할 때 비로소 Chatterbox로 전환하십시오.
둘 다 적합하지 않은 용도
두 도구 모두 각자의 핵심 설계 목표를 벗어난 영역에서는 실질적인 한계가 있습니다.
- Piper는 샘플에서 음성을 복제하는 것 자체가 불가능합니다. 요구 사항의 일부라도 참조 음성에서 특정 인물의 목소리를 재현하는 것을 포함한다면, 하드웨어 제약과 무관하게 Piper는 적합한 도구가 아닙니다 — 대신 Chatterbox나 XTTS v2를 사용하십시오.
- CPU 전용 하드웨어에서의 Chatterbox는 실시간 사용에 적합하지 않습니다. CPU(
device="cpu")에서도 동작하지만, 문서화된 저지연 성능은 GPU 가속을 전제로 합니다. CPU 전용 Chatterbox는 오프라인 배치 생성에는 적합하지만, 대화형 실시간 음성에는 적합하지 않다고 간주해야 합니다. - 두 도구 모두 실제 인물의 목소리를 복제할 때의 동의 문제를 다루지 않습니다. 본인의 인지나 동의 없이 실제로 존재하고 식별 가능한 인물의 목소리를 복제하거나 합성하는 것은 두 프로젝트의 소프트웨어 라이선스와 무관하게 존재하는 동의, 퍼블리시티권, 나아가 사기나 사칭 관련 우려를 제기합니다 — 이는 어떤 도구를 사용하든, 상업적이든 개인적이든 맥락과 무관하게 적용됩니다.
- Piper 현재 저장소의 GPL-3.0은 클로즈드 소스 재배포에 실질적인 제약을 가합니다. 배포가 Piper 자체 소스 코드를 수정해 클로즈드 소스 제품 내에서 재배포하는 것을 포함한다면 현재 저장소의 GPL-3.0-or-later 조건이 적용됩니다 — 이는 원래의 MIT 라이선스 저장소에는 존재하지 않았던 제약이므로, 2025년 10월 이전에 세운 계획은 다시 확인해야 합니다.
- Chatterbox가 보고한 ElevenLabs 대비 우위는 벤더의 주장이며 독립적인 벤치마크가 아닙니다. Chatterbox를 게시하는 Resemble AI는 제3자 플랫폼 Podonos를 통해 진행한 평가를 근거로 블라인드 평가자들이 ElevenLabs보다 Chatterbox를 선호했다고 보고합니다. PromptQuorum은 이 평가를 독립적으로 재현하지 않았습니다. 이를 검증된 제3자 결과가 아니라 모델 게시자 자체의 주장으로 받아들이고, ElevenLabs 대비 음성 품질이 프로젝트의 결정적인 요소라면 그에 맞게 가중치를 두어 판단하십시오.
대안
XTTS v2
- 가장 적합한 용도:
- 약 6초 음성으로 17개 언어에 걸친 다국어 음성 복제
- 라이선스:
- CPML(비상업용)
Coqui TTS 툴킷
- 가장 적합한 용도:
- 광범위한 언어를 지원하는 유연한 멀티 백엔드 툴킷(VITS, Tacotron2, XTTS)
- 라이선스:
- MPL-2.0
StyleTTS 2
- 가장 적합한 용도:
- 가장 자연스러운 영어 내레이션 품질(음성 복제 없음)
- 라이선스:
- MIT
Bark
- 가장 적합한 용도:
- 표현력 있는 비언어 오디오 — 웃음, 한숨, 환경음
- 라이선스:
- MIT
ElevenLabs
- 가장 적합한 용도:
- 자체 호스팅을 원하지 않는 팀을 위한 관리형 클라우드 API, 상업용 음성 복제 지원
- 라이선스:
- 독점(유료 클라우드 API)
자주 묻는 질문
Piper와 Chatterbox TTS의 주요 차이점은 무엇인가?
Piper는 고정된 사전 학습 음성 세트를 사용하고 복제 기능이 없는 경량 CPU 전용 텍스트 음성 변환 엔진입니다. Chatterbox는 짧은 참조 클립으로 특정 음성을 복제하고 GPU 가속에서 가장 잘 작동하는 Resemble AI의 5억 개 매개변수 Llama 백본 모델입니다. 두 도구는 같은 축에서 경쟁하는 것이 아니라 서로 다른 문제를 해결합니다.
Piper도 Chatterbox처럼 음성을 복제할 수 있는가?
아니요. Piper는 다운로드해서 선택한 사전 학습 음성 모델로만 음성을 합성하며, 참조 음성 샘플에서 새 목소리를 생성하는 메커니즘은 전혀 없습니다. 음성 복제가 필요하다면 대신 Chatterbox나 XTTS v2를 사용하십시오.
Chatterbox를 실행하려면 GPU가 필요한가?
엄밀히 필수는 아닙니다 — Chatterbox는 device="cpu"를 지원합니다 — 하지만 문서화된 저지연 실시간 성능은 device="cuda"를 통한 GPU 가속을 전제로 합니다. CPU 전용 Chatterbox는 오프라인 배치 생성에는 사용 가능하지만 GPU에서보다 눈에 띄게 느립니다.
Piper에는 GPU가 필요한가?
필요하지 않습니다. Piper는 Raspberry Pi를 포함한 CPU 전용 하드웨어에서 실시간으로 동작하도록 설계되었습니다. onnxruntime-gpu 패키지를 통해 더 높은 처리량을 위한 선택적 CUDA GPU 가속을 사용할 수 있지만 필수는 아닙니다.
Chatterbox는 어떤 라이선스를 사용하는가?
Chatterbox는 GitHub 저장소 resemble-ai/chatterbox의 LICENSE 파일에 따르면 MIT 라이선스를 따릅니다 — 최소한의 조건으로 상업적 사용, 수정, 재배포를 허용하는 관대한 라이선스입니다.
Piper는 어떤 라이선스를 사용하며, 변경된 적이 있는가?
현재 활발히 관리되는 OHF-Voice/piper1-gpl 저장소는 GPL-3.0-or-later 라이선스를 따릅니다. 원래의 rhasspy/piper 저장소는 개발이 Open Home Foundation으로 이전된 2025년 10월 6일 아카이브되기 전까지 MIT 라이선스였습니다. Piper를 클로즈드 소스 제품에 포함시키기 전에 현재 라이선스를 확인하십시오.
Chatterbox가 블라인드 테스트에서 ElevenLabs를 이겼다는 것이 사실인가?
Chatterbox를 게시하는 Resemble AI는 제3자 플랫폼 Podonos를 통해 진행한 평가에서 블라인드 평가자의 과반수가 ElevenLabs보다 Chatterbox를 선호했다고 보고합니다. 이는 Chatterbox 게시자 자체가 공개한 주장이며, PromptQuorum은 이를 독립적으로 재현하지 않았습니다. 독자는 이를 확립된 독립 벤치마크가 아니라 검증이 필요한 주장으로 받아들여야 합니다.
Chatterbox가 음성을 복제하려면 참조 음성이 얼마나 필요한가?
Chatterbox에 대해 Resemble AI 자체가 공개한 평가 방법론에 따르면 약 7~20초의 참조 음성이면 충분합니다. 더 깨끗하고 단일 화자인 참조 클립이 일반적으로 더 정확한 복제를 만들어냅니다.
로컬 음성 비서에는 어느 쪽을 써야 하는가?
거의 모든 경우 Piper입니다. 음성 비서는 일반적으로 소박한 CPU 전용 하드웨어에서 동작하며 특정 인물의 목소리를 복제할 필요가 없습니다 — Piper의 실시간 CPU 성능과 GPU 비의존성은 이 용도에 직접 맞아떨어지며, 이것이 Piper가 Home Assistant 음성 파이프라인의 기본 로컬 TTS 엔진인 이유입니다.
같은 프로젝트에서 Piper와 Chatterbox를 함께 사용할 수 있는가?
가능합니다 — 기술적인 충돌은 없습니다. 흔한 패턴은 빠르고 범용적인 CPU 전용 내레이션에는 Piper를 사용하고, 복제되거나 감정적으로 표현력 있는 목소리가 필요한 콘텐츠 부분에만 Chatterbox를 사용하며, 실제로 필요한 곳에서만 추가적인 GPU 요구 사항을 받아들이는 것입니다.
결론
Piper와 Chatterbox는 사실상 경쟁 관계가 아니라 서로 다른 질문에 답하는 도구입니다. "GPU 없는 하드웨어에서 빠르고 신뢰할 수 있는 완전 로컬 음성 합성을 어떻게 구현하는가"라는 질문이라면, Piper가 잘 검증된 답입니다 — Raspberry Pi에서의 실시간 동작, 복제가 필요하지도 제공되지도 않음, 그리고 간단한 pip install piper-tts 하나로 끝납니다. "짧은 참조 클립에서 특정 목소리가 새로운 내용을 말하게 하려면 어떻게 하는가"라는 질문이라면, Chatterbox는 바로 이를 위해 설계되었습니다 — MIT 라이선스, 5억 개 매개변수의 Llama 백본, 감정 표현을 조절하는 exaggeration 컨트롤을 갖추고 있지만, 잘 작동시키려면 GPU가 필요하다는 대가가 따릅니다. Chatterbox가 블라인드 평가에서 ElevenLabs보다 우위에 있다고 보고한 점은 알아둘 가치가 있지만, 이는 Resemble AI 자체의 주장이지 독립적으로 검증된 결과가 아니므로 확립된 사실이 아니라 마케팅 증거로 받아들여야 합니다. 대부분의 로컬 음성 비서 및 임베디드 프로젝트에서는 Piper로 시작하고, 특정 목소리 복제가 실제 요구 사항이 될 때만 Chatterbox로 넘어가십시오. PromptQuorum의 Piper TTS 리뷰나 XTTS v2 리뷰를 함께 참고하면 각 도구를 더 깊이 이해할 수 있습니다.
참고 자료
- GitHub의 OHF-Voice/piper1-gpl — 활발히 관리되는 Piper 저장소: README, 문서, 라이선스, 릴리스 이력.
- GitHub의 rhasspy/piper — 현재 아카이브된 원래의 Piper 저장소(MIT 라이선스), 2025년 10월 6일 아카이브됨.
- GitHub의 resemble-ai/chatterbox — Chatterbox의 공식 저장소: README, 라이선스, 설치 및 사용 문서.
- Resemble AI: Chatterbox — Podonos를 통해 보고된 ElevenLabs 대비 블라인드 평가자 선호도를 설명하는 Resemble AI 자체 페이지.
- Piper TTS 리뷰 — 2025년 라이선스 변경 이력을 포함한 PromptQuorum의 Piper 전용 리뷰.
