Skip to main content
PromptQuorum
/고급 로컬 LLM/Piper TTS 리뷰(2026): 빠르고 로컬한 신경망 음성 합성
Voice, Speech & Multimodal

Piper TTS 리뷰(2026): 빠르고 로컬한 신경망 음성 합성

·11분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

**Piper는 Michael Hansen이 Rhasspy 음성 비서 프로젝트 안에서 만든 무료 로컬 신경망 음성 합성 엔진으로, 현재는 Open Home Foundation이 OHF-Voice/piper1-gpl에서 관리하고 있으며, Raspberry Pi 같은 CPU 전용 하드웨어에서도 실시간으로 동작할 만큼 빠릅니다.** pip install piper-tts로 설치합니다. 2025년 이후 실제로 관리되는 저장소는 GPL-3.0-or-later 라이선스를 따르며, 이는 아카이브된 원래 저장소 rhasspy/piper의 MIT 라이선스에서 바뀐 것입니다. Piper, Coqui TTS, XTTS v2, F5-TTS, Bark, StyleTTS 2의 라이선스 비교는 PromptQuorum의 로컬 TTS 라이선스 가이드를 참고하십시오.

Piper는 텍스트를 오직 자신의 기기에서만 음성으로 변환하는 무료 로컬 신경망 음성 합성 엔진으로, 원래 오픈소스 음성 비서 프로젝트인 Rhasspy 안에서 Michael Hansen이 만들었습니다. 2025년, 실제 개발은 새로운 저장소 OHF-Voice/piper1-gpl로 옮겨갔으며, 이는 Home Assistant를 이끄는 비영리 단체 Open Home Foundation이 관리합니다. 원래 저장소인 rhasspy/piper는 2025년 10월 6일에 아카이브(읽기 전용) 처리되었습니다. 이 리뷰에서는 이러한 역사, 실제 설치 및 사용 명령어, 현재 라이선스(MIT에서 GPL-3.0-or-later로 변경됨), 그리고 Piper가 적합하지 않은 경우를 다루며, PromptQuorum의 라이선스 비교 가이드와 ElevenLabs와의 비교 링크도 함께 제공합니다.

Piper TTS 리뷰(2026): 빠르고 로컬한 신경망 음성 합성

핵심 요점

  • Michael Hansen이 Rhasspy 음성 비서 프로젝트 안에서 개발.
  • 원래 저장소 rhasspy/piper는 MIT 라이선스 하에 2025년 10월 6일 아카이브(읽기 전용)됨.
  • 현재 실제 개발은 Home Assistant를 이끄는 비영리 단체 Open Home Foundation 산하의 OHF-Voice/piper1-gpl(2025년 3월 28일 생성)에서 진행.
  • 현재 라이선스: GPL-3.0-or-later — 아카이브된 저장소의 MIT 라이선스에서 변경됨.
  • 무료, 유료 플랜 없음; CPU 실시간 추론, 선택적 CUDA GPU 가속.
  • 최신 릴리스: v1.8.0, 2026년 9월 4일 공개.

📍 한 문장으로

Piper는 원래 Michael Hansen이 Rhasspy 음성 비서 프로젝트 안에서 개발했고 현재는 Open Home Foundation이 관리하는 무료 로컬 신경망 음성 합성 엔진으로, Raspberry Pi 같은 CPU 전용 하드웨어에서도 실시간으로 동작할 만큼 빠르며, 2025년 새 저장소로 이전하면서 라이선스가 MIT에서 GPL-3.0-or-later로 바뀌었습니다.

💬 쉽게 말하면

pip install로 설치하는 프로그램으로, 입력한 텍스트를 자신의 기기에서 음성으로 바꿔줍니다 — 클라우드 계정도, 인터넷 연결도 필요 없으며, 매우 평범한 하드웨어에서도 실시간 음성 재생에 충분할 만큼 빠르게 동작합니다.

📌참고: 2025년에 라이선스가 변경되었습니다. 이전에 MIT 라이선스라고 가정하고 Piper를 평가한 적이 있다면, 현재 관리되는 저장소를 폐쇄 소스 제품에 사용하기 전에 다시 확인하십시오 — 자세한 내용은 아래 라이선스와 비용 섹션을 참고하십시오.

역사: Rhasspy에서 Open Home Foundation으로

Piper는 완전히 오프라인으로 동작하는 음성 비서를 만들기 위한 오픈소스 툴킷인 Rhasspy 안에서 탄생했습니다. Michael Hansen은 말할 때마다 클라우드 TTS API를 왕복하는 것을 피하기 위해, Rhasspy의 로컬 음성 인식과 결합할 빠르고 로컬한 음성 합성 엔진으로 Piper를 만들었습니다. Piper는 VITS 스타일의 신경망 텍스트-투-웨이브폼 아키텍처를 사용합니다. 텍스트는 먼저 (espeak-ng를 사용해) 음소로 변환된 다음, ONNX Runtime용으로 내보낸 모델이 그 음소로부터 직접 파형을 합성하므로, CPU 전용 하드웨어에서도 빠르게 추론할 수 있습니다.

**원래 저장소인 rhasspy/piper는 오픈소스 홈 오토메이션 및 접근성 생태계에서 가장 널리 쓰이는 로컬 TTS 엔진 중 하나로 성장했습니다.** MIT 라이선스 하에 11,000개 이상의 GitHub 스타를 모았으며, Home Assistant 음성 파이프라인의 기본 로컬 음성 합성 엔진이 되었습니다.

2025년, 실제 개발이 새로운 저장소로 이전했습니다. OHF-Voice/piper1-gpl은 2025년 3월 28일, Home Assistant도 운영하는 비영리 단체 Open Home Foundation 산하에 생성되었습니다. 이후 원래 저장소 rhasspy/piper는 2025년 10월 6일에 아카이브(읽기 전용)되었습니다. 원래의 MIT 라이선스 하에 여전히 이용할 수 있지만, 더 이상 업데이트되지는 않습니다.

새 저장소는 원래의 MIT 라이선스 대신 GPL-3.0-or-later라는 다른 라이선스를 채택했습니다. 프로젝트는 README나 변경 이력에서 그 이유를 밝히지 않았지만, piper1-gpl은 음소화를 위해 espeak-ng를 내장하고 있으며, espeak-ng 자체가 GPL-3.0 라이선스를 따릅니다 — 이는 라이선스 변경에 대한 그럴듯한 설명이지만, PromptQuorum은 이를 공식적으로 명시된 이유로 확인할 수는 없었습니다. 본 문서 작성 시점 기준, 프로젝트 자체 README에는 Open Home Foundation이 Piper를 위한 추가 관리자를 찾고 있다고 명시되어 있습니다.

Piper를 만든 사람은 누구입니까?

Piper는 오픈소스 음성 비서 프로젝트 Rhasspy 안에서 Michael Hansen이 개발했습니다. 이후 개발은 Open Home Foundation이 관리하는 새 저장소 OHF-Voice/piper1-gpl로 이전했습니다.

Piper가 실제로 하는 일

Piper는 신경망 음성 합성 파이프라인을 통해 작성된 텍스트를 음성으로 변환합니다. 텍스트는 espeak-ng를 통해 음소로 변환된 다음, 학습된 음성 모델이 그 음소로부터 파형을 합성하며, 속도를 위해 ONNX Runtime 위에서 실행됩니다.

  • 명령줄 합성. 다운로드한 음성 모델과 함께 python3 -m piper를 실행하면 WAV 파일을 생성하거나 오디오를 스피커로 직접 스트리밍할 수 있습니다.
  • Python API. PiperVoice.load()로 음성을 불러온 뒤, 자신의 Python 애플리케이션에서 .synthesize_wav()나 스트리밍용 .synthesize() 제너레이터를 호출합니다.
  • HTTP 웹 서버 모드. Piper는 상시 실행되는 웹 서버로 동작시킬 수 있어, 음성 모델을 메모리에 계속 로드해 두고 호출할 때마다 발생하는 CLI 재로딩 비용을 피할 수 있습니다 — 반복 사용이나 프로덕션 환경에 권장됩니다.
  • C/C++ API(libpiper). 예전 Piper 저장소에서 이식된 네이티브 C++ 라이브러리와 CLI로, Python이 아닌 애플리케이션에 Piper를 통합할 수 있습니다.
  • 원시 음소 주입. 텍스트를 `[[ ... ]]로 감싸면 (espeak-ng --ipa=3`으로 얻은) IPA 음소를 직접 전달할 수 있으며, 이름이나 전문 용어의 잘못된 발음을 고칠 때 유용합니다.
  • 선택적 GPU 가속. --cuda(CLI) 또는 use_cuda=True(Python)를 지정하면 onnxruntime-gpu 패키지를 통해 CUDA 가속이 활성화됩니다. 다만 Piper는 CPU만으로도 충분히 실용적인 속도로 동작하도록 설계되었습니다.
  • 커뮤니티가 학습시킨 다국어 음성. 수십 개 언어와 지역 변형이 Hugging Face에서 개별적으로 다운로드할 수 있는 음성 모델로 제공됩니다. 서로 다른 커뮤니티 기여자가 학습시키기 때문에 음성별로 품질이 다릅니다.

Piper 설치 및 실행: 단계별 가이드

이 가이드는 pip로 Piper를 설치하고, 프로젝트 자체 CLI 및 Python API 문서에 기재된 구문을 사용해 첫 음성 합성을 실행합니다.

  1. 1
    Piper를 설치합니다.
    Why it matters: Python 환경(Python 3.9 이상 권장)에서 `pip install piper-tts`를 실행합니다. 이렇게 하면 `piper` 패키지와 ONNX Runtime 의존성이 설치됩니다. CPU만 사용할 경우 별도의 GPU나 CUDA 설정은 필요하지 않습니다.
  2. 2
    음성을 나열하고 다운로드합니다.
    Why it matters: 인자 없이 `python3 -m piper.download_voices`를 실행해 사용 가능한 음성을 나열한 다음, `python3 -m piper.download_voices en_US-lessac-medium`을 실행해 특정 음성을 현재 디렉터리에 다운로드합니다.
  3. 3
    명령줄에서 음성을 합성합니다.
    Why it matters: `python3 -m piper -m en_US-lessac-medium -f test.wav -- 'This is a test.'`를 실행해 WAV 파일을 작성합니다. `ffplay`가 설치되어 있다면 `-f` 플래그를 생략해 저장 대신 바로 오디오를 들을 수 있습니다.
  4. 4
    (선택) CLI 대신 Python API를 사용합니다.
    Why it matters: 애플리케이션 내에서 반복 사용할 경우, `from piper import PiperVoice; voice = PiperVoice.load("en_US-lessac-medium.onnx")`에 이어 `voice.synthesize_wav(text, wav_file)`를 호출하면 매 호출마다 발생하는 CLI 시작 비용을 피할 수 있습니다.
  5. 5
    (선택) GPU 가속을 활성화합니다.
    Why it matters: `onnxruntime-gpu` 패키지를 설치한 다음, CLI에서는 `--cuda`를, Python에서는 `PiperVoice.load()`에 `use_cuda=True`를 전달합니다. 선택 사항입니다 — Piper는 CPU만으로도 실시간으로 동작하도록 설계되었습니다.
  6. 6
    (선택) 반복 사용을 위해 웹 서버를 실행합니다.
    Why it matters: 프로덕션이나 반복 사용 환경에서는 Piper의 HTTP 웹 서버 모드를 실행해, CLI를 호출할 때마다 다시 로드하는 대신 음성 모델을 메모리에 계속 유지하십시오.
  7. 7
    (선택) 원시 음소로 잘못 발음되는 단어를 수정합니다.
    Why it matters: `espeak-ng -v en-us --ipa=3 -q <단어>`로 단어의 IPA 음소를 얻은 다음, 입력 텍스트 안에서 `[[ ... ]]`로 감싸 그 단어에 대한 Piper의 자동 발음을 재정의합니다.

실제 사용 예시

위의 기본 설치 가이드 외에도, 다음은 프로젝트 자체 문서에 나오는 일반적인 실사용 패턴입니다.

  • 원시 음소 주입을 통한 발음 수정: espeak-ng -v en-us --ipa=3 -q <단어>로 얻은 IPA 음소를 사용해 `The [[ bˈætmæn ]] not [[ bɹˈuːs wˈeɪn ]]`처럼 텍스트를 감쌉니다.
  • libpiper C/C++ APIpiper_create()(더 세밀한 제어가 필요하면 piper_create_with_options())를 제공하여, Python 런타임 없이 네이티브 애플리케이션에 Piper를 직접 통합할 수 있습니다.
python
# 명령줄: WAV 파일 작성
python3 -m piper -m en_US-lessac-medium -f test.wav -- "This is a test."

# 명령줄: 오디오 즉시 재생 (ffplay 필요)
python3 -m piper -m en_US-lessac-medium -- "This will play on your speakers."

# Python API
import wave
from piper import PiperVoice

voice = PiperVoice.load("en_US-lessac-medium.onnx")
with wave.open("test.wav", "wb") as wav_file:
    voice.synthesize_wav("Welcome to the world of speech synthesis!", wav_file)

# Python API: 합성 설정 조정 (속도, 볼륨, 표현력)
from piper import SynthesisConfig

syn_config = SynthesisConfig(
    volume=0.5,        # 절반 음량
    length_scale=2.0,  # 두 배 느리게
    noise_scale=1.0,   # 더 많은 오디오 변화
    noise_w_scale=1.0, # 더 많은 발화 변화
)
voice.synthesize_wav("Custom synthesis settings.", wav_file, syn_config=syn_config)

# Python API: GPU 가속 (onnxruntime-gpu 필요)
voice = PiperVoice.load("en_US-lessac-medium.onnx", use_cuda=True)

# Python API: 스트리밍 합성
for chunk in voice.synthesize("Streamed audio, chunk by chunk."):
    play_audio(chunk.audio_int16_bytes, chunk.sample_rate)

라이선스와 비용

**실제로 관리되는 Piper 저장소인 OHF-Voice/piper1-gpl은 GPL-3.0-or-later 라이선스를 따릅니다.** 이는 PyPI에 공개된 piper-tts 패키지 메타데이터를 통해 확인됩니다. 이는 원래 저장소인 rhasspy/piper에서 바뀐 것으로, 이 저장소는 2025년 10월 6일 아카이브되기 전까지 MIT 라이선스였으며, 지금도 그 MIT 라이선스 하에 이용할 수 있지만 더 이상 관리되지는 않습니다.

GPL-3.0은 카피레프트 라이선스로, 상업적 이용에 있어 MIT와는 실질적으로 다릅니다. Piper를 사용해 음성을 생성하는 것은 상업적 용도를 포함해 무료로 가능합니다. 하지만 GPL-3.0은 Piper 자체 소스 코드의 수정 버전을 배포하는 경우 — 예를 들어 제품에 통합하거나 정적으로 링크한 포크 — 그 수정된 소스 코드를 동일한 GPL-3.0 조건으로 공개할 것을 요구합니다. Piper를 수정하지 않은 외부 도구로 사용하는 경우(CLI, Python 패키지, 웹 서버를 별도 프로세스로 호출하는 경우)에는 일반적으로 자신의 애플리케이션의 다른 소스 코드가 GPL의 적용을 받지 않지만, 정확한 경계는 자신의 코드가 Piper의 코드와 얼마나 밀접하게 연결되어 있는지에 따라 달라집니다. 이 단락은 라이선스의 대략적인 형태를 설명한 것이며, 법률 자문이 아닙니다 — Piper를 기반으로 한 상업 제품을 출시하기 전에 자신의 구체적인 배포 방식에 대해 변호사와 상담하십시오.

Piper 자체에는 유료 플랜, 구독, 라이선스 비용이 없습니다. 실제 비용은 이를 실행하는 하드웨어와 자신의 개발 시간뿐입니다. 음성 모델은 공유되는 Hugging Face 저장소에서 별도로 다운로드합니다. 음성은 서로 다른 커뮤니티 구성원이 기여한 것이며 Piper 코드와 동일한 라이선스임이 보장되지 않으므로, 재배포하기 전에 각 음성에 명시된 라이선스를 확인하십시오.

Piper는 어떤 라이선스를 사용합니까?

실제로 관리되는 Piper 저장소(OHF-Voice/piper1-gpl)는 GPL-3.0-or-later 라이선스를 따릅니다. 지금은 아카이브된 원래 저장소 rhasspy/piper는 MIT 라이선스였습니다. 이는 상업적 이용에 있어 실질적인 차이입니다 — GPL-3.0은 Piper 자체 소스 코드의 수정 버전을 배포할 경우 동일한 라이선스로 공개할 것을 요구하지만, MIT는 그런 요구가 없었습니다.

Piper가 적합하지 않은 용도

Piper는 빠르고 범용적인 로컬 음성 합성 엔진이지, 음성 클로닝이나 표현력 있는 발화를 위한 도구가 아닙니다. 다음과 같은 상황에서는 적합하지 않습니다:

  • 표현력 있고 감정적인, 또는 몇 초 안에 이루어지는 음성 클로닝. Piper는 사전 학습된 음성 모델로부터 음성을 합성하는 것이지, 특정 인물의 짧은 참조 오디오 클립으로부터 합성하는 것이 아닙니다. 몇 초의 샘플 오디오로 음성을 클로닝해야 하거나 더 표현력 있는 발화가 필요하다면, XTTS v2가 그 목적을 위해 만들어졌습니다 — 그 (비상업적) 라이선스 조건은 PromptQuorum의 로컬 TTS 라이선스 가이드를 참고하십시오.
  • 짧은 샘플로부터의 다중 화자 클로닝. 마찬가지로 Piper에는 특정 화자의 오디오 샘플로부터 즉석에서 새 음성을 생성하는 내장 메커니즘이 없습니다. 각 음성은 별도로 학습되고 배포되는 모델입니다.
  • 폐쇄 소스 제품에서의 GPL-3.0 카피레프트 의무. Piper 자체 소스 코드를 수정해 폐쇄 소스 바이너리 안에서 배포하는 사용 사례라면, 현재 저장소의 GPL-3.0-or-later 라이선스는 원래 MIT 라이선스 저장소에는 없던 실질적인 제약입니다. 위의 라이선스와 비용 섹션을 검토하고, 그런 종류의 배포를 하기 전에 변호사와 상담하십시오.
  • 모든 언어에서 일관되게 보장되는 음성 품질. 음성은 서로 다른 커뮤니티 구성원이 학습시키고 기여하기 때문에, 언어와 특정 음성에 따라 품질이 눈에 띄게 다릅니다 — 프로덕션 애플리케이션에 Piper를 채택하기 전에 대상 언어의 샘플을 확인하십시오.
  • 장기적인 유지보수의 확실성. 본 문서 작성 시점 기준, 프로젝트 자체 README에는 Open Home Foundation이 Piper를 위한 추가 관리자를 찾고 있다고 명시되어 있으며, 이는 그 위에 중요한 인프라를 구축하기로 결정하기 전에 고려할 점입니다.

Piper의 대안

Coqui TTS

최적의 용도:
폭넓은 언어 지원을 갖춘 유연한 멀티 백엔드 툴킷(VITS, Tacotron2, XTTS)
라이선스:
MPL-2.0

XTTS v2

최적의 용도:
몇 초의 참조 오디오로부터 이루어지는, 17개 언어 지원 음성 클로닝
라이선스:
CPML(비상업적)

StyleTTS 2

최적의 용도:
가장 자연스러운 영어 내레이션 품질(음성 클로닝 없음)
라이선스:
MIT

Bark

최적의 용도:
웃음, 한숨, 주변 소리 등 표현력 있는 비언어 오디오
라이선스:
MIT

ElevenLabs

최적의 용도:
자체 호스팅을 원하지 않는 팀을 위한 관리형 클라우드 API, 상업적 음성 클로닝 지원
라이선스:
독점(유료 클라우드 API)

자주 묻는 질문

Piper란 무엇입니까?

Piper는 Michael Hansen이 Rhasspy 음성 비서 프로젝트 안에서 만든 무료 로컬 신경망 음성 합성 엔진으로, 현재는 Open Home Foundation이 관리하고 있으며, CPU 전용 하드웨어에서도 실시간으로 동작할 만큼 빠르게 텍스트를 음성으로 변환합니다.

Piper는 무료입니까?

예. Piper에는 유료 플랜, 구독, 라이선스 비용이 없습니다. 현재는 GPL-3.0-or-later 라이선스를 따르며, 사용 자체는 무료이지만 Piper 자체 소스 코드의 수정 버전 배포에는 조건이 따릅니다 — 자세한 내용은 라이선스와 비용 섹션을 참고하십시오.

Piper를 실행하는 데 GPU가 필요합니까?

아니요. Piper는 Raspberry Pi를 포함한 CPU 전용 하드웨어에서 실시간으로 동작하도록 설계되었습니다. 더 높은 처리량이 필요하면 onnxruntime-gpu 패키지를 통해 선택적으로 CUDA GPU 가속을 사용할 수 있습니다.

rhasspy/piper와 OHF-Voice/piper1-gpl의 차이는 무엇입니까?

rhasspy/piper는 Rhasspy 프로젝트 안에서 만들어진 원래 저장소로 MIT 라이선스였으며, 2025년 10월 6일에 아카이브(읽기 전용)되었습니다. OHF-Voice/piper1-gpl은 2025년 3월 28일 Open Home Foundation 산하에 생성된, 실제로 관리되는 후속 저장소로, MIT 대신 GPL-3.0-or-later 라이선스를 따릅니다.

Piper가 특정 인물의 음성을 클로닝할 수 있습니까?

짧은 오디오 샘플로부터는 불가능합니다. Piper는 다운로드해서 선택한 사전 학습된 음성 모델을 사용해 음성을 합성하는 것이지, 몇 초의 참조 오디오로부터 즉석에서 새 음성을 클로닝하는 것이 아닙니다. 그런 목적이라면, 몇 초 안에 이루어지는 음성 클로닝을 위해 특별히 설계된 XTTS v2를 참고하십시오.

Piper는 Home Assistant에서 사용됩니까?

예. Piper는 Home Assistant의 음성 비서 파이프라인에서 기본 로컬 음성 합성 엔진이며, Home Assistant를 운영하는 것과 같은 비영리 단체인 Open Home Foundation이 관리합니다.

현재 Piper는 누가 관리합니까?

Piper는 2025년에 원래 Rhasspy에서 호스팅되던 저장소로부터 개발이 이전된 이후, Open Home Foundation 산하의 OHF-Voice/piper1-gpl 저장소에서 관리되고 있습니다. 프로젝트의 README에는 Open Home Foundation이 현재 추가 관리자를 찾고 있다고 명시되어 있습니다.

Piper의 최신 릴리스는 무엇입니까?

최신 안정 버전은 v1.8.0이며, 프로젝트 GitHub 릴리스 페이지에 따르면 2026년 9월 4일에 공개되었습니다.

결론

Piper는 여전히 평범한 하드웨어에서 진짜 로컬 음성 합성을 구현하는 가장 빠른 방법 중 하나로 남아 있습니다 — CPU만으로도 실시간으로 동작하는 성능 덕분에 Home Assistant의 기본 음성이 되었고, 새로운 관리자 체제 아래에서도 이는 변하지 않았습니다. 변한 것, 그리고 2026년에 Piper를 평가하는 모든 사람이 알아야 할 것은 라이선스입니다. 2025년 개발이 Open Home Foundation으로 이전하면서 실제로 관리되는 저장소는 MIT에서 GPL-3.0-or-later로 바뀌었으며, 이는 수정된 Piper 소스 코드를 폐쇄 소스 제품에 통합해 재배포하려는 사람에게 실질적인 차이입니다. Piper는 여전히 무료이고, 문서화가 잘 되어 있으며, 활발히 릴리스되고 있습니다(2026년 9월 기준 v1.8.0). 다만 그 관리자들 스스로도 공개적으로 더 많은 도움을 구하고 있습니다. CPU급 하드웨어에서 빠르고 오프라인이며 범용적인 음성 합성을 원한다면, Piper는 충분히 검증된 무비용 선택지입니다 — 몇 초 안에 이루어지는 표현력 있는 음성 클로닝이 필요하다면, 이 리뷰와 함께 PromptQuorum의 XTTS v2 관련 콘텐츠를 참고하거나, 관리형 클라우드 대안과 비교한 ElevenLabs 대 로컬 TTS 비교를 참고하십시오.

출처

← 고급 로컬 LLM으로 돌아가기