Skip to main content
PromptQuorum
/고급 로컬 LLM/Mac용 최고의 로컬 TTS 엔진(2026): 실제로 Apple Silicon을 사용하는 것은 무엇인가
Voice, Speech & Multimodal

Mac용 최고의 로컬 TTS 엔진(2026): 실제로 Apple Silicon을 사용하는 것은 무엇인가

·13분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

GPU 가속을 원한다면 Kokoro-82M이 Apple Silicon Mac용 최고의 로컬 TTS 엔진입니다. 커뮤니티 프로젝트 mlx-audio를 통해 Apple의 자체 MLX 프레임워크로 실행할 수 있기 때문입니다. Piper는 Intel과 Apple Silicon에서 동일하게 작동하는 가장 간단하고 이식성 높은 설치를 원할 때 최선의 선택입니다. 어느 쪽에서도 GPU를 전혀 사용하지 않기 때문입니다. 음성 클로닝이 특별히 필요하다면 XTTS v2가 선택지가 되지만, Metal(MPS) 지원은 문서화된 결함이 있는 GitHub 이슈이므로 어떤 Mac에서도 CPU 전용 성능을 예상해야 합니다. Bark는 환경 변수 뒤에 실험적인 MPS 지원이 있으며, 일부 처리는 여전히 CPU로 대체됩니다.

대부분의 "최고의 로컬 TTS" 비교 글은 모든 Mac을 동일하게 취급하지만, Apple Silicon에 따라 실제로 어떤 엔진이 적합한지가 달라집니다. Piper는 전적으로 CPU에서 실행되며 GPU를 전혀 사용하지 않습니다 — Apple Silicon Mac에서든 Intel Mac에서든 성능이 거의 동일합니다. Kokoro-82M은 커뮤니티 프로젝트인 mlx-audio를 통해 Apple의 자체 MLX 프레임워크로 실행할 수 있으며, 이 프레임워크는 Apple Silicon의 Metal GPU를 위해 특별히 제작되었습니다. 반면 XTTS v2는 Apple의 Metal Performance Shaders(MPS) 백엔드를 전혀 지원하지 않습니다 — 추적 중인 GitHub 이슈는 MPS 장치를 사용하면 그저 멈춰버린다는 사실을 기록하고 있습니다 — 따라서 어떤 Mac에서도 CPU로만 실행됩니다. 이 가이드는 각 엔진이 Apple Silicon에서 실제로 어떻게 작동하는지 비교하고, Intel Mac이 CPU 전용 옵션에 제한되는 지점을 짚어주며, 무엇을 설치해야 하는지 알려드립니다.

Mac용 최고의 로컬 TTS 엔진(2026): 실제로 Apple Silicon을 사용하는 것은 무엇인가

핵심 요점

  • Kokoro-82M: Apache-2.0, 8,200만 파라미터, 커뮤니티 mlx-audio 프로젝트를 통해 Apple의 MLX 프레임워크로 실행 — 실제 Apple Silicon 가속 경로.
  • Piper: GPL-3.0-or-later, ONNX Runtime을 통해 설계상 CPU 전용 — Intel과 Apple Silicon Mac에서 동일한 성능 프로필.
  • XTTS v2: 비상업적 CPML 라이선스, 약 6초의 오디오로 음성 복제. 다만 Metal(MPS) 지원은 추적 중인 미해결 GitHub 이슈 — Mac에서는 CPU로만 작동.
  • Bark: MIT 라이선스, 환경 변수 뒤에 있는 실험적 Apple Silicon MPS 지원. 공개 저장소는 2024년 4월 이후 커밋 없음.
  • Intel Mac은 MLX 가속 Kokoro 경로를 전혀 사용할 수 없습니다 — MLX에는 Apple Silicon이 필요합니다.

📍 한 문장으로

Apple Silicon에서의 로컬 텍스트 음성 변환에 대해, 4대 로컬 엔진 중 실제 Metal GPU 경로(Apple 자체 MLX 프레임워크 위에서 커뮤니티 mlx-audio 프로젝트를 통해)를 갖춘 것은 Kokoro-82M뿐이며, Piper는 Intel Mac에서도 동일하게 작동하는 간단한 CPU 전용 선택지이고, XTTS v2는 음성 클로닝을 제공하지만 Apple Silicon의 MPS 지원은 문서화된 결함이 있는 GitHub 이슈이며, Bark의 MPS 지원은 명시적으로 실험적입니다.

💬 쉽게 말하면

Mac에서 실행할 수 있는 모든 무료 텍스트 음성 변환 프로그램이 실제로 Mac의 그래픽 칩을 사용하는 것은 아닙니다 — 일부는 일반 프로세서에서만 작동하며, 이는 문제없이 동작하지만 낼 수 있는 속도보다는 느립니다. Kokoro는 MLX라는 프로젝트를 통해 Apple 고유의 칩 설계를 활용하도록 만들어졌습니다. 다른 엔진들은 설계상 GPU를 건너뛰거나(Piper) GPU를 사용하려다 미해결 문제에 부딪힙니다(XTTS v2, Bark).

📌참고: 이 가이드는 PromptQuorum이 독자적으로 검토한 4개의 로컬 TTS 엔진(Piper, Kokoro, XTTS v2, Bark)을 비교합니다. 각 엔진에는 설치 명령어, 라이선스 세부 사항, 전체 한계 사항을 확인할 수 있는 전용 리뷰 링크가 곳곳에 연결되어 있습니다.

실제로 어떤 로컬 TTS 엔진을 설치해야 합니까?

적합한 엔진은 GPU 가속, 음성 클로닝, 폭넓은 Mac 호환성 중 무엇이 필요한지에 따라 달라집니다 — 세 가지 모두에서 우위를 차지하는 엔진은 없습니다. Kokoro는 여기서 유일하게 실제 Apple Silicon GPU 경로를 갖춘 엔진이며, Piper는 이식성이 가장 뛰어나고, XTTS v2는 유일하게 음성을 복제할 수 있습니다.

  • 🏆 Apple Silicon에서 전반적으로 최선: mlx-audio를 통한 Kokoro-82M — 여기서 다루는 엔진 중 유일하게 실제 Metal GPU 경로를 갖추었고, 크기가 충분히 작아(8,200만 파라미터) 어떤 Apple Silicon Mac에서도 여유롭게 실행됩니다.
  • 단순성과 Intel 호환성 면에서 최선: Piper — 설계상 CPU 전용이므로 M 시리즈 칩이든 오래된 Intel Mac이든 설치와 성능이 동일합니다.
  • 음성 클로닝이 필요한 경우 최선: XTTS v2 — 약 6초의 참조 오디오로 음성을 복제할 수 있지만, 어떤 Mac에서도 CPU로만 작동하며 비상업적 용도로만 라이선스가 허용됩니다.
  • 표현력 있는 비언어 오디오 면에서 최선: Bark — 텍스트로부터 웃음, 한숨, 간단한 음악을 생성합니다. Apple Silicon GPU 지원은 실험적(부분적)이며, 저장소는 2024년 4월 이후 휴면 상태입니다.

누가 어떤 엔진을 사용해야 합니까?

GitHub 스타가 가장 많은 엔진이 아니라, 자신의 Mac과 실제 요구 사항에 맞는 엔진을 선택하십시오. GPU 가속이 중요해지는 경우는 CPU 전용 합성이 느리게 느껴질 만큼 충분한 양과 빈도로 오디오를 생성할 때뿐입니다.

  • 🧭 Apple Silicon Mac에서 가장 빠른 로컬 옵션을 원함: mlx-audio를 통한 Kokoro — 여기서 유일하게 MLX를 통해 Metal을 사용하도록 작성된 엔진.
  • 🧭 오래된 Intel 모델을 포함한 모든 Mac: Piper — 설계상 CPU 전용이므로 Apple Silicon 관련 설정이나 문제 해결이 전혀 필요 없습니다.
  • 🧭 짧은 녹음으로부터 특정 음성을 복제해야 함: XTTS v2 — Mac에서는 사실상 CPU로만 작동하며 라이선스가 비상업적이라는 점을 받아들이십시오.
  • 🧭 음성뿐 아니라 웃음, 한숨, 주변음을 원함: Bark — 다만 실험적인 Apple Silicon 경로를 위해 추가 설치 시간을 확보하고, 먼저 현재 유지보수 상태를 확인하십시오.
  • 활발한 유지보수나 확실한 성능이 필요하다면 Bark는 피하십시오 — 공개 저장소는 2024년 4월 이후 커밋이 없으며, 이는 Apple Silicon 문제와는 무관합니다.
  • 상업용 제품을 개발 중이라면 XTTS v2는 피하십시오 — Coqui Public Model License(CPML)는 비상업적이며, 이를 공개한 회사 Coqui AI는 2023년 12월에 유료 서비스를 종료했습니다.

Piper, Kokoro, XTTS v2, Bark는 Apple Silicon 적합성 면에서 어떻게 비교됩니까?

Kokoro는 이 비교에서 유일하게 실제로, 목적을 갖고 구축된 Apple Silicon GPU 경로를 가진 엔진입니다. 나머지는 설계상 또는 미해결 버그로 인해 CPU 전용입니다. 아래 표는 Mac 적합성을 실제로 좌우하는 네 가지 요소로 각 엔진을 평가합니다: Apple Silicon 가속 사용 여부, 필요한 메모리 양, macOS 설치의 번거로움, 음성 품질입니다.

엔진
Apple Silicon 가속
RAM 사용량
macOS 설치
음성 품질
Kokoro-82M있음 — MLX를 통한 Metal(mlx-audio)낮음(8,200만 파라미터, 양자화 버전 존재)pip install + mlx-audio, Apple Silicon 전용자연스러움, 대형 클라우드 모델에 근접
Piper설계상 없음 — CPU 전용 ONNX Runtime매우 낮음(음성당 약 50~100MB)pip install piper-tts, GPU 설정 불필요명료하지만 다소 기계적인 억양
XTTS v2없음 — MPS가 멈춤(GH 이슈 #3649)중간~높음(완전한 클로닝 모델)pip install coqui-tts, Mac에서는 CPU 전용고품질, 특정 음성 복제 가능
Bark실험적 — SUNO_ENABLE_MPS=True높음(small-models 플래그로 감소 가능)GitHub에서 pip install, PyPI 패키지 없음표현력 있음, 비결정적

음성 품질 평가는 각 엔진의 문서화된 아키텍처와 PromptQuorum의 전용 리뷰(각 행에 링크됨)를 기반으로 한 정성적 설명이며, PromptQuorum이 실시한 블라인드 청취 테스트가 아닙니다. 여기서는 수치화된 MOS(평균 의견 점수)나 벤치마크 수치를 주장하지 않습니다.

Mac에서 실제로 GPU를 사용하는 엔진은 무엇입니까?

실제로, 목적을 갖고 구축된 Apple Silicon Metal GPU 경로를 가진 것은 Kokoro뿐입니다. Piper는 설계상 GPU를 완전히 건너뛰며, XTTS v2와 Bark는 모두 Mac에서 GPU 지원이 미해결이거나 부분적입니다. 이는 Apple Silicon에서 이 엔진들을 가르는 가장 큰 요인이며, "Mac에서 실행된다"는 것이 곧 "Mac의 GPU를 사용한다"는 뜻이라고 가정하기 쉽지만, 대개는 그렇지 않습니다.

  • Kokoro-82M은 커뮤니티 프로젝트 mlx-audio를 통해 Apple의 자체 MLX 프레임워크로 실행되며, Apple Silicon과 Python 3.10~3.12가 필요합니다. MLX는 Apple의 오픈소스 머신러닝 프레임워크로, Apple Silicon의 통합 메모리 아키텍처 위에서 Metal을 위해 처음부터 구축되었습니다 — 이는 이 사이트의 Apple Silicon 로컬 LLM 가이드MLX 대 Ollama 대 llama.cpp 비교가 언어 모델에 대해 다루는 것과 동일한 프레임워크입니다. Hugging Face에서 hexgrad가 공개한 공식 Kokoro-82M 가중치는 원래 PyTorch 모델입니다. MLX 경로는 커뮤니티 이식판이며 Apple이나 hexgrad의 공식 릴리스가 아닙니다. mlx-audio는 또한 메모리 사용량을 줄이기 위한 bf16, 8비트, 4비트 양자화 변형도 제공합니다.
  • Piper는 Apple Silicon을 포함한 어떤 플랫폼에서도 GPU를 전혀 사용하지 않습니다 — 이는 설계이지 제약이 아닙니다. Piper는 espeak-ng로 텍스트를 음소로 변환한 다음, 빠른 CPU 추론을 위해 ONNX Runtime으로 내보낸 모델로 오디오를 합성합니다. 이 설계 선택이야말로 Piper가 Raspberry Pi에서도 실시간으로 실행되는 이유입니다 — 전체 아키텍처와 설치 단계는 PromptQuorum의 Piper TTS 리뷰를 참조하십시오.
  • XTTS v2의 Apple Silicon Metal(MPS) 지원은 현재 작동하지 않습니다. coqui-ai/TTS GitHub 저장소에서 추적 중인 이슈("Unable to use xtts_v2 with mps device on Apple Silicon")는 MPS 장치에서 XTTS v2를 실행하려는 시도가 완료되지 않고 멈춰버린다는 사실을 기록하고 있습니다. Coqui 자체 프로젝트도 XTTS v2에 대한 Apple Silicon GPU 지원을 공식적으로 지원한다고 명시하지 않습니다. 실제로 이는 XTTS v2가 Mac에서 CPU로만 작동한다는 것을 의미하며, 다른 플랫폼에서도 이를 실행하는 동일한 Coqui TTS 툴킷(MPL-2.0 라이선스)을 통해 실행됩니다.
  • Bark는 환경 변수 뒤에 실험적인 Apple Silicon MPS 지원을 갖추고 있습니다. SUNO_ENABLE_MPS=True를 설정하면 suno-ai/bark GitHub 저장소에서의 논의에 따라 Metal 가속이 활성화되지만, Bark가 의존하는 일부 PyTorch 연산자는 당시 MPS용으로 구현되지 않아 해당 단계들이 부분적으로 CPU로 대체됩니다. Bark는 또한 통합 메모리가 적은 Mac에서 메모리 부담을 줄이기 위해 특별히 SUNO_USE_SMALL_MODELS=True 플래그도 지원합니다.

Mac에서 MLX 가속으로 Kokoro를 설치하는 방법은?

이 안내는 mlx-audio GitHub 저장소에 문서화된 설정을 사용해 커뮤니티 mlx-audio 프로젝트를 설치하고, Apple의 MLX 프레임워크를 통해 Kokoro-82M을 실행합니다.

  1. 1
    Apple Silicon이며 지원되는 Python 버전인지 확인합니다.
    Why it matters: mlx-audio는 Apple Silicon Mac(M 시리즈 칩)과 Python 3.10~3.12를 필요로 합니다. MLX는 Intel Mac에서는 전혀 실행되지 않으므로, 이 경로는 Apple Silicon 전용입니다.
  2. 2
    mlx-audio를 설치합니다.
    Why it matters: Python 가상 환경에서 `pip install mlx-audio`를 실행합니다. 이 명령은 오디오 파이프라인과 함께 MLX 자체(버전 0.31 이상)를 함께 가져옵니다.
  3. 3
    명령줄에서 첫 음성 합성을 실행합니다.
    Why it matters: 이 패키지에는 처음 사용 시 Kokoro-82M 가중치를 다운로드하고 텍스트 문자열로부터 WAV 파일을 합성하는 CLI 진입점이 포함되어 있습니다 — CLI 플래그는 릴리스마다 변경될 수 있으므로 정확한 명령어는 프로젝트의 현재 README를 확인하십시오.
  4. 4
    음성을 선택하고, 원한다면 양자화 모델 변형도 선택합니다.
    Why it matters: Kokoro-82M에는 여러 언어에 걸친 54개의 음성 프리셋이 포함되어 있습니다. mlx-audio는 또한 bf16, 8비트, 4비트 양자화 변형을 제공하며, 정밀도를 약간 낮추는 대신 메모리 사용량을 줄일 수 있습니다. 통합 메모리가 적은 Mac에서 유용합니다.
  5. 5
    자신의 Python 애플리케이션에 통합합니다.
    Why it matters: 일회성 CLI 합성을 넘어서는 용도라면 CLI를 반복 호출하는 대신 mlx-audio의 Python API를 직접 호출하여, 호출마다 모델을 다시 로드하는 비용을 피하십시오.

Intel Mac에서는 무엇이 달라집니까?

Intel Mac에서는 MLX 가속 Kokoro 경로를 전혀 사용할 수 없습니다 — MLX에는 Apple Silicon이 필요하며 Intel 하드웨어에서는 전혀 작동하지 않습니다. 여기서 다루는 다른 모든 엔진은 Intel에서도 계속 작동합니다. 어느 것도 작동하기 위해 Apple Neural Engine이나 Apple Silicon 전용 GPU 가속에 의존하지 않으며, 단순히 CPU에서 실행되기 때문입니다.

  • Piper는 Intel과 Apple Silicon의 구분에 영향받지 않습니다. 모든 플랫폼에서 설계상 CPU 전용이므로, Piper에 한해서는 하드웨어 세대를 제외하면 Intel Mac이 Apple Silicon Mac과 비슷한 성능을 보입니다.
  • Kokoro는 공식 PyTorch 가중치를 통해 Intel Mac에서도 계속 작동하지만, MLX 가속 경로는 사용할 수 없습니다. mlx-audio를 통한 Apple Silicon 전용 Metal 경로는 잃게 되지만, 모델 자체(8,200만 파라미터)가 충분히 작아 CPU에서도 수용할 만한 수준으로 작동합니다.
  • XTTS v2와 Bark는 Intel과 Apple Silicon Mac에서 동일하게 작동합니다. 어차피 둘 다 현재 어떤 Mac에서도 CPU로만 작동하기 때문입니다 — XTTS v2는 MPS 지원이 결함이 있기 때문이고, Bark는 MPS 지원이 실험적이고 부분적이기 때문입니다. 둘 다 애초에 Apple Silicon에서 성숙한 가속 경로를 갖추지 못했으므로, Apple Silicon에서 Intel로 이동해도 실질적인 기능 손실은 없습니다.

이 엔진들을 사용하지 말아야 할 때는 언제입니까?

이 비교에 포함된 네 가지 엔진 모두가 모든 Mac TTS 사용 사례에 적합한 선택은 아닙니다 — 각각 다른 도구나 클라우드 API가 더 적합한 상황이 있습니다.

  • 복제된 음성과 함께 확실한 상업용 라이선스가 필요한 경우. XTTS v2의 CPML 라이선스는 비상업적이며, Coqui AI가 2023년 12월에 유료 서비스를 종료한 이후 상업용 라이선스로 이어지는 확인된 유효한 경로가 없습니다 — 관리형 상업용 클라우드 대안은 PromptQuorum의 ElevenLabs 비교를 참조하십시오.
  • 확실한 활발한 유지보수가 필요한 경우. Bark의 공개 GitHub 저장소는 2024년 4월 5일 이후 커밋이 없습니다. 지속적인 수정과 업데이트가 프로젝트에 중요하다면 Piper(Open Home Foundation이 활발히 유지보수)나 Kokoro(mlx-audio를 중심으로 활발하게 사용되는 커뮤니티 생태계)가 더 안전한 선택입니다.
  • 커뮤니티 프로젝트에 의존하지 않고 오늘 당장 프로덕션급 Apple Silicon GPU 지원이 필요한 경우. Kokoro의 MLX 경로는 커뮤니티 프로젝트를 통해 작동하며 Apple이나 hexgrad의 공식 릴리스가 아닙니다 — 좋기는 하지만 벤더가 보장하는 것은 아니라고 여기십시오.
  • 매우 제한된 Apple Silicon 메모리(8GB 기본 구성)에서 대형 로컬 LLM을 동시에 실행하면서 실시간 대화형 음성이 필요한 경우. 메모리가 제한된 Mac에서 큰 XTTS v2나 Bark 프로세스를 LLM과 함께 실행하는 것은 빠듯할 수 있습니다. Piper와 Kokoro의 작은 메모리 사용량이 더 많은 여유를 남깁니다.

자주 묻는 질문

Apple Silicon Mac용 최고의 로컬 TTS 엔진은 무엇입니까?

Apple의 자체 MLX 프레임워크를 통해 Apple Silicon GPU(Metal) 가속을 특별히 원한다면, 커뮤니티 mlx-audio 프로젝트를 통해 실행되는 Kokoro-82M이 최선의 선택입니다. 어떤 Mac에서도 동일하게 작동하는 가장 간단한 설치를 원한다면, 모든 플랫폼에서 설계상 CPU로만 작동하는 Piper가 더 나은 선택입니다.

Piper는 Mac에서 GPU를 사용합니까?

아닙니다. Piper는 Apple Silicon과 Intel Mac을 포함한 모든 플랫폼에서 설계상 CPU 전용입니다. espeak-ng로 텍스트를 음소로 변환하고 ONNX Runtime을 통해 오디오를 합성하며, 이 덕분에 GPU가 전혀 없어도 Raspberry Pi에서 실시간으로 실행됩니다.

Kokoro-82M은 Apple Silicon에서 GPU 가속으로 실행할 수 있습니까?

네, 커뮤니티 프로젝트 mlx-audio를 통해 가능합니다. 이는 Apple의 MLX 프레임워크를 통해 Kokoro-82M을 실행하며, 이 프레임워크는 Apple Silicon의 통합 메모리 아키텍처 위에서 Metal을 위해 특별히 제작되었습니다. hexgrad가 공개한 공식 Kokoro-82M 가중치는 PyTorch 모델입니다. MLX 경로는 커뮤니티 이식판이지 공식 릴리스가 아니며, Apple Silicon Mac(Intel Mac에서는 사용 불가)과 Python 3.10~3.12가 필요합니다.

XTTS v2는 Apple Silicon에서 작동합니까?

작동하지만 CPU로만 작동합니다. XTTS v2의 Metal(MPS) 장치 지원은 coqui-ai/TTS GitHub 저장소에서 추적 중인 문서화된 미해결 문제(이슈 #3649)로, MPS 장치를 사용하려 하면 완료되지 않고 멈춰버립니다. Coqui의 프로젝트는 XTTS v2에 대한 Apple Silicon GPU 가속을 공식적으로 지원하지 않으므로 어떤 Mac에서도 CPU 전용 성능을 예상해야 합니다.

Bark는 Apple Silicon에서 가속됩니까?

부분적으로, 그리고 실험적으로 가속됩니다. SUNO_ENABLE_MPS=True 환경 변수를 설정하면 Bark의 Metal GPU 가속이 활성화되지만, 의존하는 일부 PyTorch 연산자가 MPS용으로 구현되지 않아 일부 처리 단계는 여전히 CPU로 대체됩니다. Bark의 관리자 자신도 이를 실험적이며 프로덕션 준비가 되지 않았다고 설명합니다.

Intel Mac에서도 이 엔진들을 사용할 수 있습니까?

Piper, XTTS v2, Bark 모두 Intel Mac에서 작동합니다. 작동하는 데 Apple Silicon 전용 가속이 필요하지 않기 때문입니다 — 설계상 CPU에서 작동하거나(Piper), GPU 가속 경로가 어차피 미해결이거나 부분적이어서 CPU에서 작동합니다(XTTS v2, Bark). Kokoro의 MLX 가속 경로는 특별히 Apple Silicon을 필요로 하며 Intel Mac에서는 전혀 작동하지 않지만, Kokoro의 공식 PyTorch 가중치는 MLX 가속 없이도 Intel에서 계속 작동합니다.

이 엔진들 중 특정 음성을 복제할 수 있는 것은 무엇입니까?

여기서 다루는 네 가지 엔진 중 XTTS v2만이 짧은 참조 오디오 클립(공식 모델 카드에 따르면 최소 6초)으로부터 음성을 복제할 수 있습니다. Piper, Kokoro, Bark는 모두 즉석에서 임의의 음성을 복제하는 대신 사전 학습되었거나 미리 설정된 음성을 사용합니다. 전체 클로닝 세부 사항과 라이선스는 PromptQuorum의 전용 XTTS v2 리뷰를 참조하십시오.

이 로컬 TTS 엔진들 중 Apple Silicon Mac에서 사용하는 데 유료 라이선스가 필요한 것이 있습니까?

여기서 다루는 엔진 중 macOS나 Apple Silicon 사용 자체에 요금을 부과하는 것은 없습니다. Piper(GPL-3.0-or-later), Kokoro(Apache-2.0), Bark(MIT)는 모두 플랫폼과 무관하게 무료 오픈소스 소프트웨어입니다. XTTS v2는 사용 자체는 무료이지만 비상업적 라이선스(CPML) 하에 있습니다 — 이 제한은 Apple Silicon, Intel, Windows, Linux 어디에서든 동일하게 적용되며, 어떤 Mac을 사용하는지와는 무관합니다.

결론

Apple Silicon에 한해서는, Kokoro-82M이 이 네 가지 엔진 중 유일하게 Apple 자체 MLX 프레임워크 위에 구축된 커뮤니티 mlx-audio 프로젝트를 통해 Mac의 Metal GPU에 실제로, 목적을 갖고 구축된 경로를 갖추고 있어 돋보입니다 — 그리고 충분히 작아서(8,200만 파라미터, Apache-2.0 라이선스) 이 가속을 설정할 가치가 있습니다. 단순성과 하드웨어 간 일관성이 순수한 속도보다 중요할 때는 Piper가 여전히 올바른 기본 선택입니다. 모든 플랫폼에서 CPU 전용이므로 Apple Silicon 관련 설정이나 문제 해결, Intel Mac에서의 성능 저하 걱정이 전혀 없습니다. XTTS v2는 음성 클로닝이 특별히 필요하고 비상업적 라이선스를 받아들일 수 있는 경우에만 CPU 전용 성능 저하를 감수할 가치가 있습니다. Bark는 독특한 비언어적 소리 때문에만 고려할 가치가 있으며, Apple Silicon 가속과 전반적인 유지보수 상태가 모두 불안정하다는 점에 유의해야 합니다. 확신이 서지 않는다면 가장 간단한 설치인 Piper로 시작하고, Metal 가속을 원한다는 확신이 서면 mlx-audio를 통한 Kokoro로 옮겨가며, 음성 클로닝이 필수 요건이 될 때만 XTTS v2로 손을 뻗으십시오.

출처

← 고급 로컬 LLM으로 돌아가기