Skip to main content
PromptQuorum
/고급 로컬 LLM/Raspberry Pi를 위한 최고의 로컬 TTS 엔진(2026)
Voice, Speech & Multimodal

Raspberry Pi를 위한 최고의 로컬 TTS 엔진(2026)

·13분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

Piper는 Raspberry Pi를 위한 최고의 로컬 텍스트 음성 변환 엔진입니다. 이는 ONNX Runtime 기반의 신경망 TTS 엔진으로, Michael Hansen이 Rhasspy 오프라인 음성 비서 프로젝트 내부에서 리소스가 제한된 임베디드 하드웨어를 위해 특별히 개발했습니다. GPU가 필요하지 않으며, 바로 그 이유로 지금도 Home Assistant의 기본 로컬 음성으로 사용됩니다. pip install piper-tts로 설치할 수 있습니다. 실제 리소스 비용을 감수하고 더 높은 음성 품질을 원한다면 아래의 KokoroCoqui TTS/XTTS v2 섹션을 참조하십시오. 두 엔진 모두 더 무겁고, Pi급 CPU에서의 검증 사례는 더 적습니다.

Raspberry Pi를 위한 로컬 텍스트 음성 변환(TTS) 엔진을 선택한다는 것은 데스크톱 GPU가 아니라 CPU만 사용하고 메모리가 제한된 ARM 보드를 위한 선택을 의미합니다. Piper는 바로 이 하드웨어 클래스를 위한 명확한 기본 권장 사항입니다. 오프라인 음성 비서 프로젝트인 Rhasspy 내부에서 Raspberry Pi와 같은 장치에서 실시간으로 동작하도록 특별히 개발되었으며, 오늘날에도 여전히 Home Assistant의 음성 파이프라인에서 기본 로컬 TTS 엔진으로 사용되고 있습니다. 이 가이드는 Piper를 현실적인 대안인 Kokoro, Coqui TTS 툴킷XTTS v2, 그리고 더 오래된 합성기인 espeak-ng와 비교하며, RAM 사용량, CPU만으로의 실현 가능성, 설치 복잡도, 음성 품질의 트레이드오프라는 Pi 적합성 기준으로 평가합니다.

Raspberry Pi를 위한 최고의 로컬 TTS 엔진(2026)

핵심 요점

  • Piper: 임베디드/CPU 전용 하드웨어를 위해 특별히 개발되었으며, GPU가 필요 없고, Raspberry Pi 4에서 실시간으로 동작합니다.
  • Kokoro(82M 파라미터, Apache-2.0): 더 자연스러운 음성 품질이지만 Pi에서의 문서화된 실시간 벤치마크가 없습니다. Pi 4보다 Pi 5가 더 현실적입니다.
  • Coqui TTS / XTTS v2: 음성 클로닝을 추가하지만 GPU 가속을 전제로 하며, CPU 전용 Pi에는 적합하지 않습니다.
  • espeak-ng: 가장 가벼운 선택지이지만 기계적으로 들립니다. 첫 번째 선택지가 아니라 대체 수단입니다.
  • 이들 중 어느 경우든 Pi 5(Cortex-A76, 2.4GHz)는 Pi 4(Cortex-A72, 최대 1.8GHz)보다 눈에 띄게 빠른 CPU를 갖추고 있습니다.
  • Piper 설치는 명령 한 줄입니다: pip install piper-tts, 이후 음성 모델을 다운로드합니다.

📍 한 문장으로

Piper는 오프라인 음성 비서 프로젝트인 Rhasspy 내부에서 CPU 전용 임베디드 하드웨어를 위해 특별히 개발되었고, GPU가 필요하지 않으며, 바로 그 이유로 Home Assistant의 기본 로컬 음성이기 때문에 Raspberry Pi를 위한 최고의 로컬 TTS 엔진입니다. Kokoro는 더 자연스럽게 들리지만 Pi에서의 문서화된 실시간 벤치마크가 없으며, Coqui TTS/XTTS v2는 GPU 가속을 전제로 합니다.

💬 쉽게 말하면

인터넷 연결 없이 Raspberry Pi가 소리 내어 말하기를 원한다면, Piper는 바로 그 작업을 위해 만들어진 도구입니다. 설치하고 음성을 다운로드하면 약 35달러부터 시작하는 보드에서 실시간으로 말합니다. 더 화려한 선택지(Kokoro, XTTS v2)는 소리는 더 좋지만 Raspberry Pi의 제한된 CPU를 염두에 두고 설계된 것은 아닙니다.

📌참고: 이 가이드는 CPU 전용 합성 속도와 Pi 적합성을 다루며, 음성 클로닝은 다루지 않습니다. 음성 클로닝에 대해서는 Pi급 CPU에는 권장하지 않는다고 명시한 PromptQuorum의 XTTS v2 전용 리뷰를 참조하십시오.

TTS 엔진이 Raspberry Pi에 적합하기 위한 조건은 무엇입니까?

Raspberry Pi에 적합한 TTS 엔진은 GPU 없이 동작해야 하고, 모델과 런타임이 수백 MB의 RAM에 들어가야 하며, 쿼드코어 ARM CPU에서 실시간보다 빠르게 오디오를 생성할 수 있어야 합니다. Raspberry Pi에는 TTS 추론에 쓸 만한 전용 GPU가 없으므로, 여기 나열된 모든 엔진은 CPU에서 동작합니다. 따라서 결정적인 요인은 단독으로 본 모델 품질이 아니라, 각 엔진이 이러한 제약 조건에 맞춰 얼마나 효율적으로 만들어졌는가입니다.

  • GPU 의존성이 없음. Raspberry Pi에는 CUDA를 지원하는 GPU가 없습니다. 허용 가능한 속도를 위해 GPU 가속을 전제로 하는 엔진은, 기술적으로 대체 수단으로 CPU에서 동작한다 하더라도 실시간 사용에는 부적합합니다.
  • RAM 사용량. Raspberry Pi 4는 최대 8GB의 총 RAM을 운영체제 및 다른 실행 중인 서비스(Home Assistant, 웨이크워드 감지기 등)와 공유합니다. 로드만 하는 데 수 GB가 필요한 TTS 엔진은 다른 용도를 위한 여유 공간을 거의 남기지 않습니다.
  • 설치 복잡도. 사전 빌드된 ARM wheel을 사용하는 단일 pip install과, Pi에는 적용되지 않는 GPU 지향적 의존성 체인(CUDA, cuDNN)을 요구하는 툴킷은 완전히 다른 이야기입니다.
  • 음성 품질의 트레이드오프. 이 목록의 모든 엔진은 속도를 대가로 어느 정도의 품질을 희생합니다. 문제는 어떤 트레이드오프가 사용 사례에 맞는가입니다. 스마트 스피커 안내 방송과 음성 클로닝 프로젝트는 요구되는 품질 수준이 다릅니다.

Pi 적합성 기준 Piper 대 Kokoro 대 Coqui TTS/XTTS v2 대 espeak-ng

Piper는 원시 음성 품질(이 부분은 Kokoro와 XTTS v2가 앞섭니다)을 제외한 모든 Pi 관련 기준에서 최고 점수를 받습니다. 아래 표는 데스크톱이나 서버 하드웨어에서 진행하는 일반적인 TTS 벤치마크가 아니라, Raspberry Pi 배포에서 실제로 중요한 네 가지 기준으로 각 엔진을 평가합니다.

엔진
RAM 사용량
CPU 전용 실현 가능성
설치 복잡도
음성 품질
Piper낮음(모델 파일은 보통 음성당 100MB를 훨씬 밑돎)이를 위해 설계됨; Pi 4에서 실시간 동작한다는 보고가 널리 존재명령 하나: pip install piper-tts양호, 충분히 자연스러운 신경망 음성; 클로닝 불가
Kokoro중간(82M 파라미터 모델, 가중치 약 327MB)CPU에서 동작; Pi에서의 문서화된 실시간 벤치마크 없음Python 패키지 + 모델 다운로드; Piper보다 의존성이 많음더 높음 — 독립적인 TTS 품질 순위에서 상위권
Coqui TTS / XTTS v2높음; 문서화된 지연 시간 수치는 GPU VRAM을 전제로 함낮음; PromptQuorum 자체 XTTS v2 리뷰에서 CPU 전용 Pi 사용은 비현실적이라고 지적툴킷 설치와 라이선스 동의가 모두 필요(XTTS v2는 CPML)최고 — 17개 언어에 걸친 6초 음성 클로닝 포함
espeak-ng최소(수 MB)매우 쉬움; 마이크로컨트롤러를 포함한 거의 모든 하드웨어에서 동작대부분의 Linux 패키지 관리자에서 직접 사용 가능기계적인 포먼트 합성음 — 자연스러운 음성이 아님

Piper가 Raspberry Pi의 기본 권장 사항인 이유

Piper가 기본 권장 사항인 이유는 사후에 맞춰진 것이 아니라 바로 이 하드웨어 클래스를 위해 설계되었기 때문입니다. 이는 완전히 오프라인으로 동작하는 음성 비서를 구축하기 위한 오픈소스 툴킷인 Rhasspy 내부에서 탄생했습니다. 이 프로젝트의 전체 전제는 Raspberry Pi 보드를 포함한 로컬의, 흔히 사양이 낮은 하드웨어에서 클라우드 API를 오가지 않고 음성 인식과 합성을 실행하는 것입니다.

  • 임베디드 및 리소스 제약 장치를 위해 구축됨. Piper는 빠른 CPU 추론을 위해 ONNX Runtime으로 내보내진 신경망 기반 VITS 스타일 아키텍처를 사용합니다. 이는 대체 수단으로 삼을 GPU가 없는 하드웨어를 위한 의도적인 선택입니다.
  • 여전히 Home Assistant의 기본값. Piper는 Home Assistant와 동일한 비영리 단체인 Open Home Foundation이 관리하는 Home Assistant 음성 파이프라인의 기본 로컬 텍스트 음성 변환 엔진입니다. 그리고 상당수의 Home Assistant 설치가 Raspberry Pi에서 실행됩니다.
  • GPU가 전혀 필요하지 않음. 데스크톱 하드웨어에서 더 높은 처리량을 위한 선택적 CUDA GPU 가속이 존재하지만 필수는 아닙니다. Piper는 CPU만으로 실시간 동작하도록 설계되었습니다.
  • 음성 클로닝은 없으며 대신 고정된 음성 카탈로그를 제공. Piper는 샘플로부터 음성을 클로닝하는 대신 20개 이상의 언어에 걸친 수십 개의 사전 학습된 음성을 제공합니다. 이는 XTTS v2 대비 실질적인 트레이드오프이지만, 동시에 Piper의 리소스 사용량을 Raspberry Pi에 충분히 들어갈 만큼 작게 유지해 주는 요인이기도 합니다.

Kokoro: 더 높은 품질, 더 높은 비용

Kokoro는 StyleTTS2에서 파생된 8200만 파라미터, Apache-2.0 라이선스 TTS 모델로, Piper보다 눈에 띄게 더 자연스러운 음성을 생성하지만, 그 실제 리소스 비용은 Raspberry Pi 하드웨어에 특화하여 문서화되어 있지 않습니다. Piper와 달리 Kokoro는 임베디드 ARM 장치를 주요 대상으로 삼아 구축된 것이 아닙니다. 범용 하드웨어에서 더 큰 TTS 모델 대비 작고 빠르게 만드는 것을 목표로 구축되었으며, 이는 Raspberry Pi의 CPU에서의 실시간 성능과는 다른 설계 목표입니다.

  • 82M 파라미터, 가중치 약 327MB. 대형 음성 클로닝 모델과 비교하면 작지만, 보통 100MB를 훨씬 밑도는 단일 Piper 음성과 비교하면 여전히 눈에 띄게 무겁습니다.
  • Apache-2.0 라이선스. 관대하며 상업적으로 우호적입니다. XTTS v2와 같은 CPML 방식의 비상업적 제한이 없습니다.
  • 문서화된 Raspberry Pi 실시간 벤치마크 없음. PromptQuorum은 Kokoro가 Raspberry Pi 4 또는 Raspberry Pi 5 하드웨어에서 특별히 실시간으로 동작함을 보여주는, 출처가 있는 공개된 벤치마크를 찾을 수 없었습니다. 직접 벤치마크하기 전까지는 Pi에서의 Kokoro 실시간 동작에 대한 어떠한 주장도 검증되지 않은 것으로 취급해야 합니다.
  • Raspberry Pi 5가 더 현실적인 목표. 2.4GHz의 Cortex-A76 CPU는 Raspberry Pi 4의 Cortex-A72보다 눈에 띄게 더 많은 연산 성능을 제공하며, 이는 더 가벼운 Piper보다 Kokoro와 같은 더 무거운 모델에 더 중요합니다.

Coqui TTS와 XTTS v2: 음성 클로닝이 중요할 때

Coqui TTS와 그 XTTS v2 모델은 단 6초 분량의 참조 오디오만으로 음성 클로닝을 추가하지만, 둘 다 GPU 가속을 전제로 하며 CPU 전용 Raspberry Pi 하드웨어에는 현실적으로 맞지 않습니다. 프로젝트에 사전 학습된 음성이 아니라 특정 음성을 실제로 클로닝해야 한다면, 이 목록에서 그것을 해낼 수 있는 유일한 선택지입니다. 다만 Pi 자체에서 실행하는 것이 아니라 다른 곳에서 실행하고 오디오를 Pi로 스트리밍하는 계획을 세워야 합니다.

  • XTTS v2는 6초 분량의 오디오로 음성을 클로닝합니다. 공식 Hugging Face 모델 카드에 따르면 17개 언어를 지원합니다. 설치 명령어와 라이선스 세부 사항은 PromptQuorum의 XTTS v2 전체 리뷰를 참조하십시오.
  • GPU가 강력히 권장되며, CPU 전용 사용은 실시간 애플리케이션에 실용적이지 않습니다. 이는 PromptQuorum 자체 XTTS v2 리뷰에 따른 것입니다. Raspberry Pi에는 전용 GPU가 없으므로, 기기 상에서의 실시간 XTTS v2 추론은 현실적이지 않습니다.
  • XTTS v2의 라이선스인 Coqui Public Model License(CPML)는 비상업적입니다. 이는 하드웨어 적합성과는 별개의 고려 사항입니다. 전체 비교는 로컬 TTS 라이선스 가이드를 참조하십시오.
  • 클로닝된 음성이 필요한 Pi 프로젝트에서 흔히 쓰이는 패턴: GPU가 장착된 별도의 상시 실행 서버 또는 데스크톱에서 XTTS v2를 실행하여 그곳에서 오디오를 생성한 다음, 결과 오디오 파일 또는 스트림을 재생을 위해 Raspberry Pi로 전송합니다. Pi 자체에서 추론을 실행하는 것이 아닙니다.

espeak-ng: 경량 대체 수단

espeak-ng는 마이크로컨트롤러를 포함한 거의 모든 하드웨어에서 동작하는 포먼트 합성 TTS 엔진이지만, 자연스럽기보다는 기계적으로 들립니다. 이 목록의 신경망 TTS 엔진들보다 10년 이상 앞서 등장했으며 음성 품질 면에서는 진정한 경쟁자가 아닙니다. 여기 포함된 이유는 이것이 바닥선이기 때문입니다. 즉, 사실상 리소스 요구 사항이 전혀 없는 선택지입니다.

  • 사실상 어떤 환경에서도 동작. espeak-ng는 몇 MB의 메모리만 필요하며 신경망 런타임이 필요하지 않아, Raspberry Pi 사양을 훨씬 밑도는 하드웨어에서도 사용할 수 있습니다.
  • 기계적으로 들림. 학습된 신경망 모델이 아니라 음향 규칙으로부터 음성을 생성하는 포먼트 합성 방식은 이해는 가능하지만 명백히 합성된 느낌의 음성을 만들어내며, 자연스럽게 들려야 하는 음성 비서나 안내 방송 시스템에는 적합하지 않습니다.
  • 여전히 음소 변환기로서 유용함. Piper 자신도 텍스트를 음소로 변환하기 위해 내부적으로 espeak-ng를 사용합니다. 다만 Piper 자체의 오디오 출력은 espeak-ng가 아니라 Piper의 신경망 모델에서 직접 나옵니다.
  • RAM이나 CPU가 극도로 제한되어 Piper조차 실행할 수 없는 경우에만 선택. 예를 들어 Raspberry Pi가 아니라 마이크로컨트롤러급 장치가 그런 경우입니다.

Raspberry Pi에 Piper 설치하는 방법

Raspberry Pi에 Piper를 설치하는 것은 pip install 한 번과 음성 모델 하나를 다운로드하는 것으로 끝납니다. GPU 드라이버도, CUDA도, 컴파일 단계도 필요하지 않습니다. 이는 PromptQuorum의 Piper TTS 전용 리뷰에 문서화된 것과 동일한 명령어이며, 여기서는 Raspberry Pi OS(또는 다른 Debian 기반 ARM Linux 배포판)를 실행하는 Raspberry Pi에 특화하여 적용됩니다.

  1. 1
    시스템을 업데이트하고 Python 3를 설치합니다
    Why it matters: Raspberry Pi OS는 최신 이미지에 Python 3가 사전 설치되어 있지만, 새 항목을 설치하기 전에 먼저 `sudo apt update && sudo apt upgrade`를 실행하여 pip와 시스템 패키지가 최신 상태인지 확인하십시오.
  2. 2
    pip로 Piper를 설치합니다
    Why it matters: `pip install piper-tts`(이미지에 따라 `pip3 install piper-tts`)를 실행합니다. 이는 ONNX Runtime 의존성과 함께 `piper` 패키지를 설치합니다. 사전 빌드된 ARM wheel 덕분에 Raspberry Pi에서 컴파일 단계가 필요하지 않습니다.
  3. 3
    음성 모델을 다운로드합니다
    Why it matters: `piper --download-dir voices --update-voices --voice en_US-lessac-medium`을 실행합니다(Hugging Face의 Piper 음성 카탈로그에서 원하는 음성으로 대체하십시오). 중간 품질 음성이 Raspberry Pi에 적합한 기본값입니다. 고품질 음성보다 더 빠르며, 일반적인 스피커에서는 출력 차이가 무시할 만한 수준입니다.
  4. 4
    텍스트로부터 음성을 생성합니다
    Why it matters: 명령줄에서 Piper로 텍스트를 파이프로 전달합니다. 예를 들어 `echo "Hello from the Raspberry Pi." | piper --model voices/en_US-lessac-medium.onnx --output_file output.wav`를 실행한 다음, 생성된 WAV 파일을 `aplay output.wav`로 재생합니다.
  5. 5
    프로젝트에 연결합니다
    Why it matters: 웨이크워드, 음성 인식, LLM, 그리고 응답을 위한 Piper로 구성된 전체 음성 비서 파이프라인에 대해서는 PromptQuorum의 [단계별 오프라인 음성 비서 구축 가이드](/ko/power-local-llm/build-local-voice-assistant-2026)를 참조하십시오. Home Assistant의 경우 Piper는 이미 음성 파이프라인 설정에서 기본 TTS 엔진입니다.

텍스트 음성 변환을 위한 Raspberry Pi 4 대 Raspberry Pi 5

Raspberry Pi 5는 Raspberry Pi 4보다 눈에 띄게 빠른 CPU를 갖추고 있으며, 이는 이미 가벼운 Piper보다 Kokoro와 같은 더 무거운 엔진에 더 중요합니다. 두 보드 모두 Piper를 실시간으로 실행할 수 있지만, 더 무거운 옵션을 고려하기 시작하면 CPU 격차가 현실적인 선택지의 범위를 넓힙니다.

  • Raspberry Pi 4: 최대 1.8GHz로 동작하는 쿼드코어 Arm Cortex-A72 CPU, RAM 구성은 최대 8GB. Piper의 실시간 합성에는 충분하지만, Kokoro나 XTTS v2의 실시간 동작에는 현실적인 목표가 아닙니다.
  • Raspberry Pi 5: 2.4GHz로 동작하는 쿼드코어 Arm Cortex-A76 CPU(BCM2712), RAM 구성은 최대 16GB. Raspberry Pi 4 대비 CPU 성능이 2~3배 향상되었다고 문서화되어 있습니다. Piper 대신 Kokoro를 실험해 보고 싶다면 이 보드를 사용해야 합니다.
  • 어느 보드도 GPU 가속 상황을 바꾸지는 않습니다. 둘 다 전용의 CUDA 지원 GPU가 없으므로, Coqui TTS와 XTTS v2는 두 세대 모두에서 기기 상 실시간 추론에는 여전히 비현실적입니다.
  • RAM은 TTS 엔진 자체를 넘어서도 중요합니다. 동일한 보드가 Home Assistant, 웨이크워드 감지기, 또는 전체 음성 비서 파이프라인을 위한 로컬 LLM도 실행한다면, 경량 엔진(Piper, 그다음 espeak-ng)은 Kokoro나 Coqui TTS보다 이러한 다른 프로세스를 위한 여유 공간을 더 많이 남깁니다.

자주 묻는 질문

Raspberry Pi를 위한 최고의 로컬 TTS 엔진은 무엇입니까?

대부분의 사용 사례에서 Piper는 Raspberry Pi를 위한 최고의 로컬 TTS 엔진입니다. 오프라인 음성 비서 프로젝트인 Rhasspy 내부에서 CPU 전용 임베디드 하드웨어를 위해 특별히 개발되었으며, GPU가 필요하지 않고, 바로 그 이유로 지금도 Home Assistant의 기본 로컬 TTS 엔진으로 남아 있습니다. Raspberry Pi 4에서 실시간으로 동작한다는 보고가 널리 존재합니다.

Piper가 Raspberry Pi에서 실행되려면 GPU가 필요합니까?

아니요. Piper는 Raspberry Pi를 포함한 CPU 전용 하드웨어에서 실시간으로 동작하도록 설계되었습니다. 데스크톱 하드웨어에서 더 높은 처리량을 위한 선택적 CUDA GPU 가속이 존재하지만 필수는 아니며, 애초에 Raspberry Pi에는 이를 사용할 전용 GPU가 없습니다.

Kokoro는 Raspberry Pi에서 실시간으로 동작할 수 있습니까?

PromptQuorum은 Raspberry Pi 하드웨어에 특화된, 출처가 있는 문서화된 실시간 벤치마크를 찾을 수 없었습니다. Kokoro는 일반적으로 CPU에서 동작하는 8200만 파라미터 모델이지만, Piper처럼 임베디드 ARM 장치를 위해 특별히 만들어진 것은 아닙니다. 더 빠른 Cortex-A76 CPU를 갖춘 Raspberry Pi 5에서 테스트하는 것이 Raspberry Pi 4보다 더 현실적입니다. 실시간 인터랙티브 사용 사례에 의존하기 전에 직접 벤치마크하십시오.

Raspberry Pi에서 음성 클로닝에 XTTS v2를 사용하지 않는 이유는 무엇입니까?

XTTS v2는 문서화된 저지연 성능을 위해 GPU 가속을 전제로 하며, PromptQuorum 자체의 XTTS v2 리뷰는 CPU 전용 사용이 실시간 애플리케이션에 실용적이지 않다고 명시합니다. Raspberry Pi에는 전용 GPU가 없으므로, 기기 상에서의 실시간 XTTS v2 추론은 현실적이지 않습니다. 흔히 쓰이는 우회 방법은 GPU가 장착된 별도의 서버에서 XTTS v2를 실행하고 결과 오디오를 Raspberry Pi로 스트리밍하는 것입니다.

Piper는 상업적으로 무료로 사용할 수 있습니까?

현재 활발히 관리되고 있는 Piper 저장소인 OHF-Voice/piper1-gpl은 GPL-3.0-or-later 라이선스로 배포되며, 이는 현재 보관 처리된 원본 rhasspy/piper 저장소의 MIT 라이선스에서 변경된 것입니다. GPL-3.0은 도구로서 Piper의 상업적 사용을 허용하지만, Piper 자체 소스 코드를 수정하여 배포하는 경우 동일한 라이선스로 공개할 것을 요구합니다. 전체 라이선스 이력은 PromptQuorum의 전체 Piper TTS 리뷰를 참조하십시오. 이는 법률 자문이 아닙니다.

텍스트 음성 변환에서 Raspberry Pi 4와 Raspberry Pi 5의 차이는 무엇입니까?

Raspberry Pi 5는 2.4GHz로 동작하는 쿼드코어 Arm Cortex-A76 CPU(BCM2712)와 최대 16GB의 RAM 구성을 사용하며, 이는 최대 1.8GHz로 동작하고 RAM이 최대 8GB인 Raspberry Pi 4의 쿼드코어 Cortex-A72 대비 CPU 성능이 2~3배 향상되었다고 문서화되어 있습니다. 둘 다 Piper를 실시간으로 실행할 수 있습니다. Kokoro와 같은 더 무거운 엔진을 실험해 보고 싶다면 Pi 5의 추가 여유가 더 중요해집니다.

Piper는 영어 이외의 언어를 지원합니까?

예. Piper는 20개 이상의 언어에 걸친 사전 학습된 음성을 제공하지만, 특정 인물의 음성을 클로닝하지는 않습니다. XTTS v2처럼 샘플로부터 클로닝하는 대신, 언어별로 고정된 사전 학습 음성을 사용합니다.

espeak-ng란 무엇이며 언제 Piper 대신 사용해야 합니까?

espeak-ng는 Raspberry Pi 사양을 밑도는 장치를 포함해 거의 모든 하드웨어에서 동작하는 포먼트 합성 TTS 엔진이지만, 자연스럽기보다는 기계적으로 들립니다. RAM이나 CPU가 극도로 제한되어 Piper조차 실행할 수 없는 경우에만 사용하십시오. 대부분의 Raspberry Pi 프로젝트에서는 Piper가 더 나은 기본 선택지입니다. Piper 자신도 텍스트를 음소로 변환하기 위해 내부적으로 espeak-ng를 사용합니다.

Raspberry Pi에서 Piper에는 얼마나 많은 RAM이 필요합니까?

Piper의 음성별 모델 파일은 보통 100MB를 훨씬 밑돌며, 이 엔진은 실행에 수 GB의 RAM을 필요로 하지 않습니다. 이는 운영체제 및 다른 실행 중인 서비스와 공유하는 총 RAM이 2GB에 불과할 수도 있는 Raspberry Pi 4에서 실질적인 이점입니다.

결론

Raspberry Pi에서 로컬 텍스트 음성 변환을 위해서는 Piper가 올바른 기본 선택이며, 이는 근소한 차이의 결정이 아닙니다. 오프라인 음성 비서 프로젝트인 Rhasspy 내부에서 CPU 전용 임베디드 하드웨어를 위해 특별히 설계되었고, GPU가 필요하지 않으며, 명령 한 줄로 설치되고, 바로 그러한 이유로 지금도 Home Assistant의 기본 로컬 음성입니다. 보장된 실시간 응답보다 음성 품질이 더 중요하다면 Kokoro를 대신 사용하되, 반드시 사용하려는 구체적인 Raspberry Pi 모델에서 직접 벤치마크한 후에 사용하십시오. Kokoro의 문서화된 실시간 성능은 Pi급 ARM 보드에 특화된 것이 아니라 일반적인 하드웨어에서 측정된 것입니다. Coqui TTS나 XTTS v2는 정말로 음성 클로닝이 필요한 경우에만 사용하고, Pi 자체가 아니라 GPU가 장착된 별도의 머신에서 추론을 실행할 계획을 세우십시오. espeak-ng는 Piper조차 실행할 수 없을 만큼 제약이 심한 하드웨어에서 최후의 수단으로만 사용하십시오. 확신이 서지 않는다면 Piper로 시작하십시오. 바로 이 하드웨어 클래스가 실행하도록 만들어진 도구입니다.

출처

← 고급 로컬 LLM으로 돌아가기