핵심 요점
- 도구 17개, 작업 3가지: 음성 합성(8), 음성 인식(7), 실시간 음성 에이전트(4). Izwi와 Willow Inference Server는 음성 합성과 음성 인식을 모두 하므로 두 표에 모두 나타납니다.
- 표는 각 도구의 레코드로 생성되며 공식 README 또는 사이트와 대조해 확인합니다. 대시는 "문서에 명시되지 않음"을 뜻하며, "아니오"를 뜻하지 않습니다.
- 라이선스는 중요한 방식으로 서로 다릅니다. 예를 들어 Piper와 OpenAI Edge TTS는 GPL-3.0, Coqui TTS는 MPL-2.0, XTTS-v2는 Coqui Public Model License를 사용하고, Bark, StyleTTS 2, whisper.cpp, faster-whisper는 MIT입니다.
- 표의 모든 도구 이름은 해당 도구의 PromptQuorum 리뷰로 연결되며, 설치 단계와 한계는 그곳에서 다룹니다.
📍 한 문장으로
로컬 음성 도구는 음성 합성, 음성 인식, 실시간 음성 에이전트라는 세 가지 서로 다른 작업이므로, PromptQuorum 디렉터리의 도구 17개를 작업별로 비교하며, 각 도구의 리뷰와 같은 도구 데이터로 생성한 표를 사용합니다.
💬 쉽게 말하면
어떤 도구는 텍스트를 소리 내어 읽어 주고, 어떤 도구는 말한 내용을 받아 적고, 어떤 도구는 AI와 음성으로 대화합니다. 읽어 주는 도구와 받아 적는 도구를 "음성 복제"로 비교하는 것은 의미가 없으므로, 이 가이드는 같은 종류끼리 비교합니다.
비교 방법
각 도구의 사실 정보 — 가격, 라이선스, 플랫폼, 하드웨어 요구 사항, 카테고리별 속성 — 는 해당 도구의 디렉터리 레코드에 한 번만 저장됩니다. 아래 비교표는 이 레코드로 생성되고 도구의 리뷰도 같은 레코드를 바탕으로 하므로, 둘이 서로 다른 값을 제시할 수 없습니다.
카테고리별 속성(예: 음성 복제, 실시간 받아쓰기)은 각 프로젝트의 공식 README 또는 웹사이트에서 가져와 그곳의 정확한 표현과 대조해 확인했습니다. 문서에 언급이 없는 경우 추측하지 않고 표에 대시를 표시하며, 주장에 단서가 붙는 경우(실험적 기능, 유료 플랜 전용, GPU 의존)에는 해당 속성을 표에서 제외하고 도구의 리뷰에서 다룹니다.
이 비교는 자신의 하드웨어에서 실행되는 도구를 나열합니다. 순위를 매기지는 않습니다. 어떤 도구가 맞는지는 각자의 조건에 달려 있으며, 아래 섹션에서 실제로 무엇이 다른지 짚어 줍니다.
비교표
아래에서 작업을 선택한 다음 행을 따라 읽으십시오. 도구 이름을 클릭하면 해당 PromptQuorum 리뷰 전문이 열립니다.
| 도구 | 가격 | 라이선스 | 플랫폼 | 실행 방식 | 하드웨어 | 버전 | 언어 | 음성 복제 | 스트리밍 출력 | CPU만으로 사용 가능 | 로컬 API 서버 | 리뷰 | 제품 링크 · 공개됨 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Bark | 무료 | MIT | macOS, Windows, Linux | 로컬 | CPU만으로 충분 | — | 13 | 아니오 | — | — | — | 리뷰 읽기 → | Bark |
| Coqui TTS | 무료 | MPL-2.0 | macOS, Windows, Linux | 로컬 | CPU만으로 충분 | v0.27.5 | — | 예 | 예 | — | 예 | 리뷰 읽기 → | Coqui TTS |
| Izwi | 무료 | MIT | macOS, Windows, Linux | 로컬 | 모델에 따라 다름 | v0.1.0-beta-17 | — | 예 | — | 예 | 예 | 리뷰 읽기 → | Izwi |
| openai-edge-tts | 무료 | GPL-3.0 | macOS, Windows, Linux | 하이브리드 | CPU만으로 충분 | — | — | — | 예 | — | 예 | 리뷰 읽기 → | openai-edge-tts |
| Piper TTS | 무료 | GPL-3.0 | macOS, Windows, Linux | 로컬 | CPU만으로 충분 | — | — | — | — | — | 예 | 리뷰 읽기 → | Piper TTS |
| StyleTTS 2 | 무료 | MIT | macOS, Windows, Linux | 로컬 | CPU만으로 충분 | — | — | — | — | — | — | 리뷰 읽기 → | StyleTTS 2 |
| Willow Inference Server | 무료 | Apache-2.0 | Linux, Windows | 로컬 | CPU만으로 충분 | — | — | 예 | 예 | — | 예 | 리뷰 읽기 → | Willow Inference Server |
| XTTS v2 | 무료 | CPML | macOS, Windows, Linux | 로컬 | — | — | 17 | 예 | — | — | — | 리뷰 읽기 → | XTTS v2 |
"—"는 프로젝트 자체 문서에 해당 내용이 명시되어 있지 않다는 뜻이며, 기능이 없다는 뜻이 아닙니다. 값은 각 프로젝트의 공식 README 또는 사이트에서 가져왔으며, 도구의 리뷰가 갱신될 때 다시 확인합니다.
음성 합성: 무엇이 다른가
- 라이선스. Bark와 StyleTTS 2는 MIT 라이선스입니다. Coqui TTS는 MPL-2.0입니다. XTTS-v2는 Coqui Public Model License(CPML)를 사용하는데, 이는 표준 오픈소스 라이선스가 아니라 고유한 조건을 가진 맞춤 라이선스이므로 상업적으로 사용하기 전에 반드시 읽어 보십시오. Piper와 OpenAI Edge TTS는 GPL-3.0이며, 수정본을 배포할 때 조건이 붙습니다. 이 중 어떤 것으로든 제품을 만들기 전에 라이선스를 확인하십시오 — Piper TTS와 XTTS v2를 참고하십시오.
- 음성 복제. Coqui TTS(리뷰), XTTS-v2(리뷰), Izwi(리뷰), Willow Inference Server(리뷰)는 음성 복제 또는 사용자 지정 음성을 문서화하고 있습니다. Bark는 사용자 지정 음성 복제를 지원하지 않는다고 명시합니다.
- 로컬 API 서버. Coqui TTS, Izwi, OpenAI Edge TTS, Piper, Willow Inference Server는 서버 구성 요소를 문서화하고 있어 다른 앱이 HTTP로 호출할 수 있습니다. OpenAI Edge TTS는 이를 중심으로 만들어졌습니다.
- 언어. Bark는 13개 언어, XTTS-v2는 17개 언어를 문서화하고 있습니다. 다른 도구는 비교 가능한 수치를 명시하지 않으므로 표에는 숫자 대신 대시가 표시됩니다.
음성 인식: 무엇이 다른가
- 실시간 받아쓰기. whisper.cpp는 실시간 스트리밍 예제를 문서화하고 있으며, Izwi와 Willow Inference Server는 실시간 사용을 문서화하고 있습니다. faster-whisper는 받아쓰기 라이브러리이며, 자체 README에는 실시간 모드가 문서화되어 있지 않습니다.
- 화자 구분. Izwi와 FunClip은 화자 구분을 문서화하고 있습니다. Meetily는 유료 Pro 플랜에서만 화자 분리(diarization)를 제공합니다. whisper.cpp의 화자 전환 표시는 실험적이며 표가 아니라 해당 리뷰에서 다룹니다.
- 가격과 플랫폼. MacWhisper는 무료 플랜과 유료 업그레이드가 있는 독점 macOS 앱이며, 여기 있는 대부분의 다른 도구는 무료 오픈소스입니다. Meetily의 커뮤니티 에디션은 무료이며 MIT 라이선스이고, 유료 Pro 플랜이 있습니다.
- 로컬 API 서버. whisper.cpp는 서버를 제공하며, Izwi와 Willow Inference Server는 HTTP API를 문서화하고 있습니다.
음성 에이전트: 무엇이 다른가
- 완전 로컬과 선택적 클라우드. Jarvis는 로컬 음성 입력, LLM, 음성 출력 스택을 문서화하고 있으며, Parlor는 선택적 클라우드 조사 기능이 있는 로컬 파이프라인을 문서화하고 있습니다. Voxa는 로컬 음성 제공자 또는 클라우드 제공자를 사용할 수 있으므로, 로컬 제공자를 선택한 경우에만 완전 로컬입니다.
- 끼어들기(barge-in). Jarvis, Parlor, Voxa는 에이전트가 말하는 도중에 끼어들 수 있다고 문서화하고 있습니다.
- 자체 LLM 연결과 전화 통화. Dograh는 LLM 선택과 전화 연동을 문서화하고 있으며, Voxa는 로컬 데몬을 통해 자체 모델을 연결하는 방법을 문서화하고 있습니다.
이 비교로 알 수 없는 것
- 이 비교는 품질이 아니라 문서화된 기능을 비교합니다. 음성이 얼마나 자연스러운지, 받아쓰기가 얼마나 정확한지는 알려 주지 않으며, 이는 직접 준비한 오디오와 하드웨어로 확인해야 합니다.
- 속도 벤치마크는 포함하지 않습니다. PromptQuorum은 이 도구들에 대해 속도를 측정하지 않았습니다.
- 대시는 프로젝트 문서의 공백이며 부정적인 결과가 아닙니다. 일부 도구는 README에 언급되지 않은 기능을 지원할 수도 있습니다.
- 도구는 빠르게 변합니다. 각 도구의 리뷰에는 확인한 버전이 명시되어 있으며, 이 가이드는 리뷰가 갱신될 때 함께 갱신됩니다.
자주 묻는 질문
음성 합성, 음성 인식, 음성 에이전트를 왜 따로 비교합니까?
이들은 서로 다른 작업을 하므로 대부분의 속성은 한 작업 안에서만 의미가 있습니다. 음성 복제는 음성 합성에, 화자 구분은 받아쓰기에, 끼어들기는 음성 에이전트에 해당합니다. 하나의 표에서 비교하면 대부분의 칸이 비거나 무의미해집니다.
비교표의 대시는 무슨 뜻입니까?
프로젝트 자체 문서에 해당 속성이 명시되어 있지 않다는 뜻입니다. 기능이 없다는 뜻이 아닙니다. 도구의 리뷰나 저장소를 확인하십시오.
이 도구들은 정말 로컬입니까?
자신의 하드웨어에서 실행되도록 설계되어 있지만, 일부는 선택적 클라우드 기능을 제공하며 — 예를 들어 Parlor의 선택적 클라우드 조사나 Voxa의 클라우드 음성 제공자 — 일부는 처음 실행할 때 모델을 내려받기 위해 인터넷이 필요합니다. 각 도구의 리뷰에서 이를 다룹니다.
이 도구들 중 제휴 링크가 있는 것이 있습니까?
없습니다. PromptQuorum은 작성 시점 기준으로 이 비교에 포함된 어떤 도구와도 제휴 관계가 없으며, 여기의 어떤 링크도 수수료를 발생시키지 않습니다.
이 비교는 얼마나 자주 갱신됩니까?
표가 각 리뷰와 같은 데이터로 생성되므로, 연 2회, 그리고 나열된 도구의 리뷰가 갱신될 때마다 함께 갱신됩니다.
출처
- 각 도구의 공식 README 또는 웹사이트. 해당 도구의 PromptQuorum 리뷰에 나열되어 있습니다(비교표에서 연결).
- PromptQuorum 로컬 AI 앱 디렉터리 — 표의 각 행이 생성되는 원본 레코드.
- AI 도구 라이선스 설명 — 위에 언급된 라이선스 계열의 의미.