핵심 요점
- Piper: 원래 Rhasspy/Home Assistant 생태계에서 시작되었으며, 현재는 Open Home Foundation이 관리; ONNX Runtime 기반; GPU 없는 Raspberry Pi에서 편안하게 실행.
- Kokoro: hexgrad가 만든 8,200만 파라미터 모델로, StyleTTS2와 ISTFTNet에서 파생; Apache-2.0 라이선스; CPU나 적당한 GPU에서 잘 작동.
- 두 엔진 모두 제로샷 음성 복제를 수행하지 않음; 둘 다 고정된 사전 학습 음성 세트를 제공.
- Piper 라이선스: GPL-3.0-or-later(현재 저장소); 원래 아카이브된 저장소는 MIT였음. Kokoro 라이선스: Apache-2.0.
- Piper는 순수한 속도와 최소한의 리소스 사용에서 우위; Kokoro는 커뮤니티 청취 비교에서 더 자연스럽다는 평가가 널리 보고됨.
- 임베디드/엣지 기기와 음성 비서에는 Piper를 사용하고, 최소 가능한 하드웨어에 맞추는 것보다 오디오 품질이 중요할 때는 Kokoro를 사용.
📍 한 문장으로
Piper는 GPU 없는 Raspberry Pi에서 실행되는 더 빠르고 가벼운 로컬 텍스트 음성 변환 엔진(GPL-3.0-or-later 라이선스)이며, Kokoro는 약간의 속도를 희생하고 눈에 띄게 더 자연스러운 오디오를 얻는 8,200만 파라미터 오픈 웨이트 모델(Apache-2.0)입니다. 둘 다 샘플로 음성을 복제하지 않습니다.
💬 쉽게 말하면
둘 다 클라우드 API를 호출하지 않고 자신의 컴퓨터에서 완전히 텍스트를 음성 오디오로 변환합니다. Piper는 더 작고 빠르기 때문에 Raspberry Pi 같은 저렴한 하드웨어에서도 동작하지만 다소 기계적으로 들립니다. Kokoro는 약간 더 큰 모델로 눈에 띄게 더 사람처럼 들리지만, 그 대가로 약간 더 많은 컴퓨팅 성능이 필요합니다.
📌참고: Piper와 Kokoro 모두 짧은 참조 클립에서 음성을 복제하지 않습니다. 이 기능이 필요하다면 PromptQuorum의 XTTS v2 리뷰를 참조하십시오——Piper와 Kokoro와 달리 XTTS v2의 라이선스는 비상업적이라는 점에 유의하십시오.
각 엔진의 실제 정체
Piper와 Kokoro는 데이터가 기기를 벗어나지 않도록 로컬 하드웨어에서 텍스트를 음성 오디오로 변환한다는 동일한 기본 문제를 해결하지만, 서로 다른 계보에서 나왔으며 크기와 품질 사이의 트레이드오프도 다릅니다.
- Piper는 오프라인 음성 비서를 위한 오픈 소스 툴킷인 Rhasspy 내에서 Michael Hansen이 원래 만든 신경망 텍스트 음성 변환 엔진입니다. espeak-ng로 텍스트를 음소로 변환한 다음, VITS 방식 모델을 사용해 이 음소로부터 파형을 합성하며, 이 모델은 CPU 전용 하드웨어에서도 빠른 추론을 위해 ONNX Runtime으로 내보내집니다. Home Assistant의 음성 파이프라인에서 기본 로컬 TTS 엔진이 되었으며, 현재는 Open Home Foundation이 OHF-Voice/piper1-gpl에서 관리합니다. PromptQuorum은 전용 Piper 리뷰에서 이를 상세히 다룹니다.
- Kokoro는 hexgrad로 알려진 개발자가 Hugging Face에 공개한 8,200만 파라미터 오픈 웨이트 TTS 모델입니다. 그 아키텍처는 StyleTTS 2를 기반으로 ISTFTNet 보코더를 사용하며, 확산(diffusion) 단계가 없는 디코더 전용 설계로, 파라미터 수가 더 많은 많은 TTS 모델보다 더 작고 간단한 파이프라인입니다. Hugging Face 모델 카드에 따르면 관대한 라이선스 또는 퍼블릭 도메인 오디오 수백 시간으로 학습되었으며, 버전 1.0은 2025년 1월 27일에 공개되었습니다.
- 두 모델 모두 짧은 참조 클립에서 음성을 복제하지 않습니다. Piper와 Kokoro는 각각 선택 가능한 고정된 사전 학습 음성 세트를 제공합니다——이는 6초의 샘플 오디오로부터 새로운 음성으로 발화를 합성하는 XTTS v2와 같은 음성 복제 모델과는 근본적으로 다른 기능입니다(다만 비상업적 라이선스입니다).
- 둘 다 자신의 하드웨어에서 완전히 오프라인으로 실행됩니다. 두 엔진 모두 텍스트나 오디오를 클라우드 API로 전송하지 않습니다——전체 합성 파이프라인이 로컬에서 실행되며, 이는 개인정보에 민감한 애플리케이션과 글자당 과금되는 클라우드 TTS 비용을 피하는 데 중요합니다.
Piper vs Kokoro: 나란히 비교
Piper는 속도와 최소한의 하드웨어 요구 사항에서 우위이고, Kokoro는 체감 오디오 품질에서 우위입니다. 아래 표는 실제 트레이드오프를 요약한 것입니다——"음성 품질" 행은 구체적인 벤치마크 점수가 아니라 정성적이고 널리 보고된 커뮤니티의 인상으로 취급하십시오. PromptQuorum은 둘을 직접 비교하는 단일한 권위 있는 수치 벤치마크를 찾을 수 없었습니다.
출처 / 관리 주체
- Piper:
- Rhasspy 프로젝트 → Open Home Foundation
- Kokoro:
- 독립 개발자(hexgrad)
파라미터 수
- Piper:
- 단일 대표 수치 미공개(VITS 방식, 음성별 모델)
- Kokoro:
- 8,200만 파라미터
아키텍처
- Piper:
- VITS 방식, ONNX Runtime
- Kokoro:
- StyleTTS 2 + ISTFTNet, 디코더 전용
라이선스
- Piper:
- GPL-3.0-or-later(현재 저장소)
- Kokoro:
- Apache-2.0
하드웨어 요구 사항
- Piper:
- CPU 전용, Raspberry Pi에서 실시간
- Kokoro:
- CPU 또는 적당한 GPU
음성 품질(커뮤니티 보고)
- Piper:
- 빠르고 크기 대비 준수, 다소 기계적
- Kokoro:
- 더 자연스럽고/표현력 있다는 평가가 널리 알려짐
음성 복제
- Piper:
- 없음——고정된 사전 학습 음성
- Kokoro:
- 없음——고정된 사전 학습 음성
설치
- Piper:
pip install piper-tts- Kokoro:
pip install kokoro
실제 사용 예시
이 명령어들은 각 프로젝트가 공식 문서화한 설치 및 API 패턴을 따릅니다. CLI 플래그와 패키지 이름은 릴리스마다 변경될 수 있으므로, 배포 전에 각 프로젝트의 최신 GitHub/Hugging Face 문서를 확인하십시오.
- Piper는 시작이 더 빠릅니다. 음성별 ONNX 모델이 빠르게 로드되고 CPU에서 합성이 거의 즉각적이므로, 제한된 하드웨어에서 대화형 음성 비서로 흔히 선택됩니다.
- Kokoro의 파이프라인은 합성을 청크로 묶습니다(위의
gs/ps/audio튜플). 긴 텍스트에 대해 단일 호출이 연속된 하나의 오디오 버퍼를 반환한다고 가정하기 전에 알아둘 가치가 있습니다.
# ── Piper: 설치 및 합성 ─────────────────────────────
pip install piper-tts
python3 -m piper.download_voices en_US-lessac-medium
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."
# Piper Python API
from piper import PiperVoice
voice = PiperVoice.load("en_US-lessac-medium.onnx")
with open("test.wav", "wb") as wav_file:
voice.synthesize_wav("Fast, local speech synthesis.", wav_file)
# ── Kokoro: 설치 및 합성 ────────────────────────────
pip install kokoro soundfile
# Kokoro Python API (Hugging Face의 hexgrad/Kokoro-82M 기준)
from kokoro import KPipeline
import soundfile as sf
pipeline = KPipeline(lang_code="a") # "a" = 미국 영어
generator = pipeline(
"Kokoro produces noticeably natural-sounding speech from a small model.",
voice="af_heart",
)
for i, (gs, ps, audio) in enumerate(generator):
sf.write(f"output_{i}.wav", audio, 24000)라이선스와 비용
Piper의 현재 활발히 관리되는 저장소인 OHF-Voice/piper1-gpl은 GPL-3.0-or-later 라이선스입니다. 이는 원래의 rhasspy/piper 저장소에서 변경된 것으로, 이 저장소는 2025년 10월 6일에 아카이브(읽기 전용으로 전환)되기 전까지는 MIT 라이선스였으며, 현재도 그 MIT 라이선스 하에 계속 이용할 수 있지만 더 이상 관리되지 않습니다. GPL-3.0은 카피레프트 라이선스입니다. 음성을 생성하기 위해 Piper를 상업적으로도 무료로 사용할 수 있지만, Piper 자체 소스 코드의 수정 버전을 배포하는 경우 해당 수정본을 동일한 GPL-3.0 조건으로 공개해야 합니다. Piper를 수정하지 않은 외부 도구로 사용하는 경우(CLI, Python 패키지, 또는 별도 프로세스로 호출되는 웹 서버) 일반적으로 애플리케이션의 나머지 부분이 GPL 대상이 되지는 않지만, 정확한 경계는 코드가 Piper의 코드와 얼마나 밀접하게 결합되어 있는지에 달려 있습니다——이는 법률 자문이 아니므로, 구체적인 배포에 대해서는 변호사와 상담하십시오.
Kokoro는 Apache-2.0 라이선스입니다. 이는 Hugging Face 모델 카드에서 확인됩니다. Apache-2.0은 카피레프트 의무가 없는 관대한 라이선스입니다——라이선스의 표준 저작자 표시 및 특허 허여 조건을 따르는 한, 자신의 소스 코드를 공개할 필요 없이 클로즈드 소스 상업 제품을 포함하여 Kokoro를 사용, 수정, 재배포할 수 있습니다.
두 엔진 모두 유료 등급, 구독, 또는 라이선스 요금이 없습니다. 유일한 비용은 실행에 사용하는 하드웨어와 자신의 개발 시간입니다. 대신 상업적 음성 복제를 갖춘 관리형 유료 클라우드 TTS API를 원한다면, PromptQuorum의 ElevenLabs와 로컬 TTS 비교를 참조하십시오.
Kokoro TTS는 상업적 이용이 무료입니까?
예. Kokoro는 카피레프트 의무가 없는 관대한 라이선스인 Apache-2.0이므로, 라이선스의 표준 저작자 표시 및 특허 허여 조건을 따르는 한 자신의 소스 코드를 공개할 필요 없이 클로즈드 소스 상업 제품에 사용할 수 있습니다. 이는 법률 자문이 아닙니다——상업적 배포 전에 Apache-2.0 라이선스를 직접 읽어보십시오.
Piper는 상업적 이용이 무료입니까?
예, Piper를 사용한 음성 생성은 상업적 이용이 무료입니다. 현재 라이선스인 GPL-3.0-or-later는 카피레프트 라이선스로, Piper 자체 소스 코드의 수정 버전을 배포하는 경우에만 조건을 부과합니다——외부 도구로 사용하는 경우 일반적으로 자신의 애플리케이션의 다른 코드가 GPL 대상이 되지는 않습니다. 이는 법률 자문이 아닙니다——구체적인 배포에 대해서는 변호사와 상담하십시오.
누가 어떤 것을 사용해야 하는가
CPU 사이클이나 메모리가 심하게 제한된 임베디드 기기, 음성 비서, 모든 배포에는 Piper를 선택하십시오. 오디오 품질이 우선순위이고 최소한 적당한 CPU 또는 GPU 예산을 투입할 수 있다면 Kokoro를 선택하십시오.
- 다음의 경우 Piper를 선택하십시오: Raspberry Pi나 그와 유사하게 제한된 기기에서 실행 중이거나, 첫 오디오까지의 지연 시간을 가능한 한 최소화해야 하거나, Piper가 기본 로컬 TTS 엔진인 Home Assistant의 음성 파이프라인과 통합하는 경우.
- 다음의 경우 Kokoro를 선택하십시오: 오디오북, 내레이션, 또는 청취자가 기계적인 음성을 알아차릴 만한 콘텐츠를 제작 중이며, 절대적인 최소치를 넘어서는 CPU 또는 GPU 여유가 있는 경우.
- 다음의 경우 둘 다 선택하지 말고 대신 XTTS v2를 참조하십시오: 짧은 참조 클립에서 특정 인물의 목소리를 복제해야 하는 경우——Piper와 Kokoro 모두 고정된 사전 학습 음성만 사용하며, 둘 다 음성 복제를 수행하지 않습니다. 복제 가능한 대안과 해당 라이선스에 대해서는 PromptQuorum의 XTTS v2 리뷰(비상업적 라이선스) 또는 로컬 TTS 라이선스 가이드를 참조하십시오.
- 다음의 경우 둘 다 선택하지 말고 대신 ElevenLabs 비교를 참조하십시오: 명확한 유료 라이선스를 갖춘 상업 등급 음성 복제가 필요하고 셀프 호스팅을 원하지 않는 경우. PromptQuorum의 ElevenLabs와 로컬 TTS 비교를 참조하십시오.
둘 다 적합하지 않은 용도
Piper와 Kokoro는 둘 다 고정 음성, 복제 불가능한 TTS 엔진입니다. 다음 상황에는 둘 다 적합한 도구가 아닙니다.
- 샘플 클립에서 특정 인물의 목소리를 복제하는 것. 두 엔진 모두 사전 학습된 음성만 제공합니다——짧은 참조 녹음으로부터 이전에 들어본 적 없는 새로운 목소리로 음성을 생성하는 메커니즘은 어느 쪽에도 없습니다. 대신 비상업적 라이선스에 유의하여 XTTS v2를 참조하십시오.
- 감정 표현이 풍부한 비음성 오디오(웃음소리, 한숨, 주변음). 두 엔진 모두 음성을 합성할 뿐, Bark와 같은 모델이 대상으로 하는 더 넓은 표현적 오디오 범위는 다루지 않습니다.
- 리소스 비용과 무관하게 가능한 최대의 오디오 충실도. 리소스 제약이 없고 특히 최고 품질의 영어 내레이션을 원하는 독자에게는, PromptQuorum의 StyleTTS 2 리뷰가 Kokoro와 유사한 기본 아키텍처를 가지면서도 다른 크기/품질 트레이드오프를 가진 모델을 다룹니다.
- Piper 자체 소스 코드를 수정하는 클로즈드 소스 제품 내부의 GPL-3.0 코드베이스. 배포 계획에 수정된 Piper 소스 코드를 포크하거나 정적으로 링크하여 클로즈드 소스 바이너리에 포함시키는 것이 포함된다면, Piper의 현재 GPL-3.0-or-later 라이선스는 실질적인 제약이 됩니다——Kokoro의 Apache-2.0 라이선스에는 이러한 제약이 없습니다.
대안
XTTS v2
- 최적 용도:
- 6초 참조 오디오로부터의 음성 복제
- 라이선스:
- CPML(비상업적)
Coqui TTS 툴킷
- 최적 용도:
- XTTS v2 및 기타 모델을 실행하는 소프트웨어
- 라이선스:
- MPL-2.0(툴킷만)
Bark
- 최적 용도:
- 표현력 있는 비음성 오디오——웃음소리, 한숨, 주변음
- 라이선스:
- MIT
StyleTTS 2
- 최적 용도:
- 가장 자연스러운 영어 내레이션(음성 복제 없음)
- 라이선스:
- MIT
ElevenLabs
- 최적 용도:
- 상업적 음성 복제를 갖춘 관리형 클라우드 API
- 라이선스:
- 독점(유료 클라우드 API)
자주 묻는 질문
Piper와 Kokoro TTS의 주요 차이점은 무엇입니까?
Piper는 속도와 최소한의 리소스 사용에 최적화된 경량의 완전 로컬 신경망 TTS 엔진으로, Raspberry Pi를 포함한 CPU 전용 하드웨어에서 실시간으로 실행됩니다. Kokoro는 눈에 띄게 더 자연스러운 오디오를 생성하는 8,200만 파라미터 오픈 웨이트 모델로, 약간 더 많은 컴퓨팅 성능이 필요하지만 여전히 CPU나 적당한 GPU에서 실행됩니다.
Piper와 Kokoro 중 어느 쪽이 더 자연스럽게 들립니까?
커뮤니티 청취 비교에서는 Kokoro가 Piper보다 더 자연스럽게 들린다는 평가가 널리 보고됩니다. PromptQuorum은 두 엔진을 직접 비교하는, 독립적으로 검증된 권위 있는 단일 수치 벤치마크를 찾을 수 없었습니다——따라서 이를 측정된 점수가 아니라 정성적이고 널리 보고된 커뮤니티의 인상으로 취급하십시오.
Piper나 Kokoro는 음성 복제를 지원합니까?
아니요. 두 엔진 모두 선택 가능한 고정된 사전 학습 음성 세트를 제공합니다——둘 다 짧은 참조 오디오 샘플로부터 새로운 음성을 복제하지 않습니다. 음성 복제가 필요하다면 비상업적 라이선스에 유의하여 PromptQuorum의 XTTS v2 리뷰를 참조하십시오.
GPU 없이 Kokoro를 실행할 수 있습니까?
예. 8,200만 파라미터의 Kokoro는 CPU에서 실행되며, 적당한 GPU가 있으면 합성 속도가 빨라집니다. 더 큰 TTS나 음성 복제 모델이 흔히 요구하는 것과 같은 GPU 하드웨어는 필요하지 않습니다.
Piper는 Raspberry Pi에서 실행할 수 있습니까?
예——Raspberry Pi에서 CPU 전용 실시간 합성은 Piper의 주요 설계 목표 중 하나이며, Raspberry Pi 하드웨어에서 자주 실행되는 Home Assistant의 음성 파이프라인에서 기본 로컬 텍스트 음성 변환 엔진입니다.
Kokoro는 어떤 라이선스를 사용합니까?
Kokoro는 카피레프트 의무가 없는 관대한 라이선스인 Apache-2.0이며, 이는 Hugging Face 모델 카드에서 확인됩니다. 라이선스의 표준 저작자 표시 및 특허 허여 조건을 따르는 한, 자신의 소스 코드를 공개할 필요 없이 클로즈드 소스 상업 제품에 사용할 수 있습니다.
Piper는 어떤 라이선스를 사용합니까?
Piper의 현재 활발히 관리되는 저장소(OHF-Voice/piper1-gpl)는 GPL-3.0-or-later 라이선스입니다. 원래의, 현재는 아카이브된 rhasspy/piper 저장소는 MIT 라이선스였습니다. GPL-3.0은 Piper 자체 소스 코드의 수정 버전을 배포하는 경우에만 조건을 부과합니다. 외부 도구로 사용하는 경우 일반적으로 자신의 애플리케이션이 GPL 대상이 되지는 않습니다.
Piper와 Kokoro는 누가 관리합니까?
Piper는 원래 Rhasspy 음성 비서 프로젝트 내에서 Michael Hansen이 만들었습니다. 현재의 활발한 개발은 Home Assistant를 뒷받침하는 비영리 단체인 Open Home Foundation이 관리합니다. Kokoro는 hexgrad로 알려진 개발자가 공개했으며 Hugging Face를 통해 배포됩니다.
Piper와 Kokoro는 몇 개 언어를 지원합니까?
Hugging Face 모델 카드에 따르면 Kokoro의 내장 54개 음성은 미국 및 영국 영어, 스페인어, 프랑스어, 힌디어, 이탈리아어, 일본어, 브라질 포르투갈어, 중국어 표준어를 포함한 8개 언어 및 억양 그룹에 걸쳐 있습니다. Piper의 음성 카탈로그는 더 크고 더 파편화되어 있습니다——다양한 커뮤니티 구성원이 기여한 수십 개의 언어와 지역 변형이 있으며 음성마다 품질이 다릅니다.
결론
Piper와 Kokoro는 정확히 같은 용도를 두고 경쟁하지 않습니다. 제약이 하드웨어일 때——Raspberry Pi, 임베디드 기기, CPU만으로 즉각 응답해야 하는 음성 비서——Piper가 올바른 선택이며, 수정된 Piper 소스 코드를 재배포하지 않는 한 그 GPL-3.0-or-later 라이선스는 상업적 이용에도 무료입니다. 제약이 오디오 품질일 때는 Kokoro가 올바른 선택입니다. 8,200만 파라미터임에도 여전히 작고 CPU 친화적이지만, 커뮤니티 청취 비교에서는 일관되게 Piper보다 더 자연스럽다고 평가되며, Apache-2.0 라이선스에는 카피레프트 제약이 전혀 없습니다. 두 도구 모두 샘플 클립에서 음성을 복제하지 않습니다——그것이 실제로 필요한 것이라면 이 비교는 답이 아닙니다. 대신 PromptQuorum의 XTTS v2 리뷰나, 관리형 상업 옵션을 위한 ElevenLabs 비교를 참조하십시오. 확신이 서지 않는다면 가장 마찰이 적은 설치와 가장 빠른 결과를 위해 Piper로 시작하고, 출력 품질이 기준에 미치지 못하면 Kokoro로 전환하십시오.
출처
- Hugging Face의 Kokoro-82M — 모델 카드: 파라미터, 아키텍처, 라이선스, 음성, 공개일.
- GitHub의 hexgrad/kokoro — Kokoro 파이프라인 소스 및 API 문서.
- GitHub의 OHF-Voice/piper1-gpl — 현재 활발히 관리되는 Piper 저장소, 그 라이선스 및 문서.
- GitHub의 rhasspy/piper — 원래의, 현재는 아카이브된 MIT 라이선스 저장소.
- Piper TTS 리뷰 — 2025년 재라이선스 이력을 포함한, PromptQuorum의 Piper 전용 리뷰.
