Skip to main content
PromptQuorum
/고급 로컬 LLM/Izwi 리뷰: TTS·STT·음성 복제를 위한 로컬 음성 AI
Voice, Speech & Multimodal

Izwi 리뷰: TTS·STT·음성 복제를 위한 로컬 음성 AI

·10분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

Izwi는 텍스트 음성 변환, 음성 인식, 화자 분리, 음성 복제를 하나의 OpenAI 호환 API 뒤에 결합한 무료 오픈소스 로컬 우선 음성 AI 런타임으로, 여러 개의 개별 클라우드 음성 서비스를 한 번에 대체하는 로컬 드롭인으로 사용할 수 있습니다. macOS, Linux, Windows용 데스크톱 앱과 웹 UI, CLI로 제공되며, MIT 라이선스를 따르고 로컬 추론에는 계정이나 API 키가 필요하지 않습니다.

Izwi(github.com/izwi-ai/izwi)는 텍스트 음성 변환, 음성 인식(STT), 화자 분리(diarization), 음성 복제를 하나의 OpenAI 호환 API 뒤에 묶은 무료 오픈소스 로컬 우선 음성 AI 런타임으로, 데스크톱 앱, 웹 UI, 명령줄 도구로 제공됩니다. "Izwi"는 줄루어와 코사어로 "목소리"를 뜻합니다. 이 리뷰에서는 Izwi가 무엇을 하는지, 어떤 모델을 지원하는지, 하드웨어 요구 사항은 무엇인지, 그리고 누구에게 적합한지 다룹니다.

핵심 요점

  • Izwi(github.com/izwi-ai/izwi)는 텍스트 음성 변환, 음성 인식, 관련 오디오 작업을 위한 무료 오픈소스 로컬 우선 음성 AI 런타임입니다
  • "Izwi"는 줄루어와 코사어로 "목소리"를 뜻합니다
  • GitHub 저장소의 LICENSE 파일로 확인된 MIT 라이선스
  • 동일한 로컬 추론 서버를 기반으로 하는 데스크톱 앱(macOS, Linux, Windows), 웹 UI, 명령줄 도구로 제공됨
  • 이 리뷰 시점 기준 GitHub 스타 383개 이상, 포크 40개
  • 아직 베타 단계: 저장소의 가장 최근 커밋 푸시는 2026년 9월 13일이지만, 가장 최근 태그된 릴리스는 v0.1.0-beta-17(2026년 6월 22일)입니다

📍 한 문장으로

Izwi는 텍스트 음성 변환, 음성 인식, 화자 분리, 음성 복제를 하나의 OpenAI 호환 API 뒤에 묶은 무료 오픈소스(MIT) 로컬 우선 음성 AI 런타임으로 — 데스크톱 앱, 웹 UI, CLI로 제공되며 — GitHub 스타 383개 이상을 보유하고 있습니다.

💬 쉽게 말하면

Izwi는 텍스트를 음성으로 바꾸고, 음성을 텍스트로 바꾸며, 샘플로부터 음성을 복제할 수 있는, 자신의 컴퓨터에 설치하는 소프트웨어입니다 — 모두 ElevenLabs나 OpenAI의 오디오 엔드포인트 같은 유료 클라우드 API를 거치지 않고 로컬에서 실행됩니다. API 형식이 OpenAI 자체 형식과 일치하므로, 해당 API용으로 만들어진 많은 기존 앱이 최소한의 변경만으로 Izwi를 대신 가리키도록 할 수 있습니다.

📌참고: 이 리뷰는 Izwi 자체 GitHub 저장소, README, 그리고 GitHub API를 통한 릴리스 이력을 기반으로 합니다. PromptQuorum이 Izwi가 지원하는 특정 모델의 오디오 품질이나 전사 정확도를 독립적으로 벤치마크했다고 주장하지 않습니다.

Izwi란 무엇인가?

Izwi는 텍스트 음성 변환, 음성 인식, 화자 분리, 음성 복제 같은 여러 개의 개별 음성 작업을, 각각 다른 클라우드 서비스를 요구하는 대신 하나의 OpenAI 호환 API 뒤에 묶은 무료 오픈소스 로컬 우선 음성 AI 런타임입니다. 자체 README는 이를 "음성, 채팅, 오디오 워크플로를 위한 로컬 우선 음성 AI"로 설명합니다.

  • 제품 유형: 네이티브 데스크톱 앱, 브라우저 기반 웹 UI, CLI라는 세 가지 프런트엔드를 갖춘 로컬 추론 서버 — 모두 동일한 기반 엔진과 통신
  • 저장소: github.com/izwi-ai/izwi, 생성일 2026년 1월 23일
  • 라이선스: MIT, 저장소의 LICENSE 파일로 확인됨
  • 웹사이트: izwiai.com, 별도 문서는 izwiai.com/docs에 있음
  • 자금 조달: 이 리뷰에서는 자금 조달 라운드, 투자자, 상업적 후원에 대한 어떤 증거도 찾지 못했습니다 — Izwi를 겉보기에 독립적이고 커뮤니티가 지원하는 오픈소스 프로젝트로 취급하십시오
  • 규모: 이 리뷰 시점 기준 GitHub 스타 383개 이상, 포크 40개

Izwi로 무엇을 할 수 있는가?

Izwi는 데스크톱 앱, 웹 UI, CLI 중 무엇을 사용하든 하나의 일관된 인터페이스를 통해 말하기, 듣기, 복제, 로컬 모델 관리라는 네 가지 관련 음성 작업을 다룹니다.

  • 텍스트 음성 변환: 음성 디자인과 저장된 커스텀 보이스를 지원하며, 장문의 "Studio" 프로젝트를 포함해 텍스트를 음성 오디오로 변환
  • 음성 복제: 지원되는 TTS 모델 계열을 사용해 참조 샘플로부터 복제된 음성으로 음성을 생성
  • 음성 인식: 오디오 파일을 전사하며, 실시간 오디오를 위한 스트리밍 전사도 지원
  • 화자 분리 및 강제 정렬: 다중 화자 오디오에서 누가 무엇을 말했는지 식별하고, 전사된 텍스트를 정확한 오디오 타임스탬프에 정렬
  • 실시간 음성 대화: 로컬 자동 음성 인식, 로컬 채팅 모델, 로컬 텍스트 음성 변환을 결합해 음성 어시스턴트와 개념적으로 유사한 음성 주고받기를 구현
  • 모델 관리: 앱 내에서 모델을 다운로드, 로드, 언로드, 삭제; 채팅 기록을 보고 결과를 내보내기
  • OpenAI 호환 API: 모델, 채팅 완성, 오디오 음성, 오디오 전사를 위한 /v1 경로에 더해 Responses API 형식에 대한 프리뷰 지원까지 제공하므로, 기존 OpenAI API 클라이언트 코드가 최소한의 변경만으로 로컬 Izwi 서버를 가리키도록 할 수 있는 경우가 많음

Izwi는 어떤 모델을 지원하는가?

Izwi는 단일 모델이 아니라 런타임입니다 — 작업별로 여러 개의 교체 가능한 모델 계열을 지원하므로, 자신의 하드웨어와 품질 요구 사항에 맞는 모델을 선택할 수 있습니다.

텍스트 음성 변환

Izwi가 지원하는 모델 계열(카탈로그 기준):
Qwen3-TTS, Kokoro-82M, Voxtral TTS, VibeVoice

음성 인식

Izwi가 지원하는 모델 계열(카탈로그 기준):
Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio, Voxtral Mini

화자 분리 및 정렬

Izwi가 지원하는 모델 계열(카탈로그 기준):
Sortformer(화자 분리), Qwen3 ForcedAligner(타임스탬프 정렬)

채팅

Izwi가 지원하는 모델 계열(카탈로그 기준):
Qwen3, Qwen3.5, LFM2.5, Gemma

지원 모델은 릴리스마다 추가되거나 변경될 수 있으므로, 현재 활성화된 카탈로그를 확인하려면 로컬에서 izwi list를 실행하십시오. 일부 모델 가중치는 자체 별도 라이선스나 사용 제한을 갖고 있으므로, 재배포나 상업적 사용 전에 izwiai.com/docs/models에서 Izwi의 Models Guide를 확인하십시오.

사용 예시

Izwi의 CLI는 모델을 다운로드하고 나면 몇 개의 명령만으로 핵심 작업을 처리합니다.

bash
# Start the local server with the web UI
izwi serve --mode web

# Download a TTS model, then generate speech
izwi pull Qwen3-TTS-12Hz-0.6B-Base
izwi tts "Hello from Izwi." --output hello.wav

# Download a speech-to-text model, then transcribe a file
izwi pull Parakeet-TDT-0.6B-v3
izwi transcribe audio.wav --model Parakeet-TDT-0.6B-v3

플랫폼, 가격, 라이선스

플랫폼

Izwi가 명시하는 내용:
macOS, Linux, Windows용 데스크톱 앱이며, 동일한 로컬 엔진을 기반으로 하는 웹 UI와 CLI/서버로도 제공됩니다.

비용

Izwi가 명시하는 내용:
무료이며 오픈소스입니다. 로컬 추론에는 계정, 구독, API 키가 필요하지 않습니다. 일부 모델 가중치는 자체 별도 라이선스 조건을 가질 수 있습니다.

라이선스

Izwi가 명시하는 내용:
GitHub 저장소의 LICENSE 파일로 확인된 MIT입니다.

하드웨어 가속

Izwi가 명시하는 내용:
macOS Apple Silicon 릴리스 빌드는 macOS 15 이상에서 Metal을 사용하며 macOS 12-14에서는 CPU로 대체됩니다. Linux와 Windows 릴리스 빌드는 기본적으로 CPU 전용이며, NVIDIA CUDA는 Docker CUDA 프로필 또는 소스 빌드를 통해 지원됩니다.

상태

Izwi가 명시하는 내용:
아직 베타 단계입니다 — 가장 최근 태그된 릴리스는 v0.1.0-beta-17이며, 해당 태그 이후로도 커밋 활동이 계속되고 있습니다.

하드웨어 가속 지원은 릴리스마다 바뀔 수 있으므로, 설치하기 전에 izwiai.com/docs/support-matrix에서 현재 Runtime Support Matrix를 직접 확인하십시오.

Izwi vs. Whisper.cpp + Piper

Izwi는 전사용 Whisper.cpp와 텍스트 음성 변환용 Piper라는 흔한 2-도구 로컬 음성 스택을 하나의 런타임과 하나의 API로 대체하지만, 그 대가로 더 젊고 아직 베타 단계인 프로젝트입니다.

범위

Izwi:
하나의 API 뒤에서 TTS, STT, 화자 분리, 정렬, 음성 복제를 다루는 하나의 런타임
Whisper.cpp + Piper(개별):
STT 전용인 Whisper.cpp와 TTS 전용인 Piper라는 두 개의 별도 프로젝트를 직접 실행하고 통합

API 형식

Izwi:
OpenAI 호환 /v1 경로로, 기존 OpenAI API 클라이언트 코드가 최소한의 변경만으로 작동하는 경우가 많음
Whisper.cpp + Piper(개별):
각 도구가 자체 CLI/라이브러리 인터페이스를 가지며, 기본적으로 둘을 아우르는 공유되거나 OpenAI 호환되는 API는 없음

음성 복제

Izwi:
호환되는 TTS 모델 계열을 통해 지원
Whisper.cpp + Piper(개별):
Piper와 Whisper.cpp 자체는 지원하지 않음

프로젝트 성숙도

Izwi:
베타 릴리스만 존재(최신: v0.1.0-beta-17); 2026년 1월 생성
Whisper.cpp + Piper(개별):
둘 다 개별적으로 오랫동안 자리 잡고 널리 배포된 프로젝트

인터페이스

Izwi:
하나의 프로젝트에서 제공하는 데스크톱 앱, 웹 UI, CLI
Whisper.cpp + Piper(개별):
명령줄/라이브러리 도구; GUI는 서드파티 래퍼에서 제공

음성 복제를 포함한 여러 음성 작업을 위한 하나의 런타임과 하나의 API 표면을 원한다면 Izwi를 선택하십시오. 각 도구의 오랜 개별 실적을 구체적으로 원하거나 두 작업 중 하나만 필요하다면 Whisper.cpp와 Piper를 따로 선택하십시오. 각각에 대한 자세한 내용은 Whisper.cpp 리뷰Piper TTS 리뷰를 참조하십시오.

Izwi는 누구에게 적합한가?

Izwi는 별도의 클라우드 API나 단일 목적 로컬 도구를 이어 붙이는 대신 여러 음성 작업을 다루는 하나의 로컬 도구를 원하는 개발자와 기술 사용자에게 적합합니다.

Izwi가 적합하지 않은 경우

Linux/Windows에서 별도 설정 없이 GPU 가속이 필요하거나 오랫동안 자리 잡은 비-베타 제품이 필요하다면 Izwi는 적합하지 않습니다.

  • Linux나 Windows에서 기본적으로 GPU 가속이 되지 않음 — Docker CUDA 프로필을 사용하거나 소스에서 빌드하지 않는 한 릴리스 빌드는 CPU에서만 실행됨
  • 1.0 릴리스가 아님 — 가장 최근 태그된 버전은 베타(v0.1.0-beta-17)이므로 API와 기능 세트가 아직 자리 잡아가는 중임을 예상해야 함
  • 단일 목적의 최소한 도구가 아님 — 하나의 작업(예: TTS만)만 필요하다면 Piper 같은 전용 도구를 실행하는 편이 더 간단할 수 있음
  • 최신 코드에 맞는 태그된 릴리스가 보장되지 않음 — 이 리뷰는 가장 최근 커밋 푸시(2026년 9월 13일)와 가장 최근 태그된 릴리스(2026년 6월 22일) 사이에 격차가 있음을 발견함
  • 이 리뷰가 확인할 수 있는 자금 조달 라운드나 기업의 후원을 받지 않음 — 독립적으로 유지 관리되는 커뮤니티 지원 프로젝트로 취급할 것

Izwi 평가 시 흔한 실수

Izwi에 대한 대부분의 혼란은 이를 단일 모델로 가정하거나, 어디서나 기본적으로 GPU 가속이 될 것이라 기대하거나, 아직 1.0 이전 단계라는 점을 놓치는 데서 비롯됩니다.

경쟁 제품 및 대안

Izwi는 다른 로컬 또는 오픈소스 텍스트 음성 변환 및 음성 인식 도구와 가장 직접적으로 비교되며, 그중 여러 도구를 하나의 통합 API 뒤에서 대체할 수 있습니다.

Tool
Best known for
Link
Whisper.cpp빠르고 널리 사용되는 로컬 음성 인식 엔진으로, OpenAI Whisper의 C/C++ 포트Whisper.cpp 리뷰
Piper가볍고 널리 배포된 로컬 텍스트 음성 변환 엔진으로, 저전력 기기에서 자주 사용됨Piper TTS 리뷰
Coqui TTS음성 복제를 지원하는 오픈소스 텍스트 음성 변환 툴킷Coqui TTS 리뷰
MacWhisperWhisper를 기반으로 만들어진 로컬 전사용 macOS 데스크톱 앱MacWhisper 리뷰

이 목록은 로컬 음성 AI 분야에서 Izwi와 흔히 비교되는 도구를 반영한 것이며, PromptQuorum의 독립적인 순위가 아닙니다 — 선택하기 전에 각 도구의 현재 기능 세트와 하드웨어 지원을 확인하십시오.

자주 묻는 질문

Izwi란 무엇입니까?

Izwi(github.com/izwi-ai/izwi)는 텍스트 음성 변환, 음성 인식, 화자 분리, 음성 복제를 하나의 OpenAI 호환 API 뒤에 묶은 무료 오픈소스(MIT) 로컬 우선 음성 AI 런타임입니다.

Izwi는 무료입니까?

예, Izwi는 무료 오픈소스(MIT 라이선스)입니다. 로컬 추론에는 계정, 구독, API 키가 필요하지 않습니다. 일부 다운로드된 모델 가중치는 자체 별도 라이선스 조건을 가질 수 있습니다.

"Izwi"는 무슨 뜻입니까?

"Izwi"는 줄루어와 코사어로 "목소리"를 뜻합니다.

Izwi는 Windows에서 실행됩니까?

예, Izwi는 macOS(.dmg), Linux(.deb) 빌드와 함께 Windows 설치 프로그램(.exe)을 제공합니다. Windows와 Linux 릴리스 빌드는 기본적으로 CPU 전용이며, GPU 가속(Metal)은 Apple Silicon Mac에서 사용할 수 있습니다.

Izwi는 음성 복제를 지원합니까?

예, 카탈로그의 호환되는 텍스트 음성 변환 모델 계열을 통해 지원하며 전적으로 자신의 컴퓨터에서 실행됩니다.

Izwi는 어떤 음성 인식 모델을 지원합니까?

Izwi의 현재 모델 카탈로그 기준으로 Parakeet, Whisper, Qwen3-ASR, Nemotron 3.5 ASR, VibeVoice ASR, LFM2.5 Audio, Voxtral Mini를 지원합니다 — 활성화된 모델을 확인하려면 로컬에서 izwi list를 실행하십시오.

Izwi는 OpenAI 호환 API를 사용합니까?

예. 모델, 채팅 완성, 오디오 음성, 오디오 전사를 위한 /v1 경로를 노출하며, Responses API 형식에 대한 프리뷰 지원도 제공합니다.

Izwi는 완성된 1.0 제품입니까?

아니요. 이 리뷰 시점 기준 가장 최근 태그된 릴리스는 베타(v0.1.0-beta-17)이므로, API와 모델 카탈로그가 계속 변경될 것을 예상해야 합니다.

Izwi는 제 오디오나 전사 내용을 어딘가로 전송합니까?

Izwi 자체 README에 따르면 추론 데이터는 컴퓨터 안에 머무릅니다. 선택적 익명 데스크톱 분석 기능은 기본적으로 꺼져 있으며, 활성화하더라도 프롬프트, 전사 내용, 오디오 페이로드, 파일 경로, 개인 식별자는 포함하지 않는다고 명시되어 있습니다.

Izwi는 어떻게 설치합니까?

GitHub Releases에서 자신의 플랫폼용 설치 프로그램(macOS는 .dmg, Linux는 .deb, Windows는 .exe)을 다운로드하거나, 프로젝트의 설치 스크립트나 소스 빌드로 CLI/서버만 설치할 수 있습니다.

출처

← 고급 로컬 LLM으로 돌아가기