핵심 요점
- Willow Inference Server는 무료이며 오픈소스입니다. 공식 GitHub LICENSE는 Apache License 2.0입니다
- Whisper 기반 자동 음성 인식(ASR)과 텍스트 음성 변환(TTS)을 실행하며 WebRTC, REST, WebSocket으로 접근 가능
- Docker Compose를 통해 Linux에 배포됨(Windows는 WSL 경유). CPU 전용 Docker Compose 파일도 제공되지만, CPU 성능은 GPU보다 훨씬 느리다고 문서화되어 있음
- GTX 1060 3GB부터 RTX 4090까지의 NVIDIA GPU에서 실행되며, 기본 Whisper 모델 크기를 모두 TTS와 함께 실행하려면 약 6GB VRAM 권장
- 비교적 짧은 샘플 녹음으로 맞춤 TTS 음성을 만들 수 있음
- 오픈소스 음성 비서 하드웨어 프로젝트 Willow의 백엔드로 Tovera가 개발
- 일반적인 LLM/채팅 추론은 더 이상 지원하지 않음 — 이 기능은 2026년 2월 커밋에서 명시적으로 제거되었으며, 프로젝트 관리자들은 해당 용도로 Ollama 같은 별도 도구를 WIS와 함께 실행하도록 안내함
- GitHub 저장소(github.com/toverainc/willow-inference-server)는 2026년 9월 기준 약 510개의 스타를 보유하며, 커밋 활동은 지속적이라기보다 단속적임 — 인력이 풍부한 상업 프로젝트보다 규모가 작고 속도가 느린 프로젝트로 간주해야 함
📍 한 문장으로
Willow Inference Server는 자신의 NVIDIA GPU에서 Whisper 기반 음성 인식과 텍스트 음성 변환을 실행하는 무료 오픈소스 셀프호스팅 서버로, 유료 플랜이 전혀 없습니다.
💬 쉽게 말하면
음성 녹음을 클라우드 음성 API로 보내는 대신, Willow Inference Server는 음성-텍스트 및 텍스트-음성 모델을 자신이 직접 관리하는 컴퓨터(보통 NVIDIA 그래픽 카드를 탑재한 기기)에서 실행합니다. 원래 Willow 음성 비서 하드웨어 프로젝트를 구동하기 위해 만들어졌지만, 클라우드 의존 없이 음성을 텍스트로 또는 텍스트를 음성으로 변환해야 하는 모든 앱에서 단독으로도 동작할 수 있습니다.
📌참고: 이 리뷰는 로컬 AI 소프트웨어 디렉터리에 있는 Willow Inference Server 항목의 심층 버전입니다 — 수십 개의 다른 로컬 AI 도구와 한눈에 비교하려면 해당 페이지를 확인하세요.
Willow Inference Server란?
Willow Inference Server는 자신의 하드웨어에서 음성 인식 및 음성 합성 모델을 실행하는 셀프호스팅 서버로, WebRTC, REST, WebSocket을 통해 접근할 수 있습니다. 자체 GitHub 설명에는 "Open source, local, and self-hosted highly optimized language inference server supporting ASR/STT, TTS, and LLM across WebRTC, REST, and WS"라고 적혀 있지만, 이 리뷰는 이 설명이 이제 일부 구식이 되었다고 판단했습니다. 일반 LLM 지원이 2026년 2월 코드베이스에서 제거되었기 때문입니다(아래 역사 섹션 참조). 이 리뷰 작성 시점 기준으로 WIS는 일반 LLM 서버가 아니라 ASR/TTS 서버로 정확히 설명할 수 있습니다.
- 핵심 기능: WebRTC, REST, WebSocket을 통해 오디오나 텍스트를 받아 전사된 텍스트나 합성된 오디오를 반환하는 음성 추론 서버
- 음성 인식 엔진: OpenAI의 Whisper 모델을 프로젝트가 저지연 스트리밍 용도에 맞게 조정
- 텍스트 음성 변환 엔진: 번들된 TTS 파이프라인(저장소에는 전용
Dockerfile.xtts와xtts디렉터리가 포함됨)으로, 짧은 샘플 녹음에서 맞춤 음성을 만들 수 있도록 지원 - 배포 대상: CUDA 지원 NVIDIA GPU이며, 성능이 낮은 CPU 전용 대체 경로도 문서화되어 있음
- 개발사: 오픈소스 음성 비서 하드웨어 프로젝트 Willow를 운영하는 조직 Tovera
- 표준 저장소: github.com/toverainc/willow-inference-server — 서버의 소스코드, 릴리스, 이슈 트래커를 위해 현재 활발히 사용되는 프로젝트 및 조직 이름
Willow Inference Server 프로젝트 역사
Willow Inference Server의 GitHub 저장소는 2023년 2월에 생성되었으며, 커밋 이력은 지속적인 주간 개발이 아니라 긴 조용한 기간 사이사이에 활동이 몰리는 패턴을 보입니다 — 프로덕션에서 의존하기 전에 알아두어야 할 패턴입니다.
- 12023년 2월 — 저장소 생성
Why it matters: Willow Inference Server는 Tovera 조직이 함께 유지관리하는 음성 비서 하드웨어 프로젝트 Willow의 백엔드 파트너로 시작되었습니다. - 22024년 4월 — TTS 엔진 업데이트
Why it matters: 저장소의 커밋 이력에 따르면 이 시기의 커밋들이 번들된 XTTS 음성 클로닝 파이프라인을 업데이트했습니다. - 32025년 6월 — 코드 품질 정리
Why it matters: 일련의 커밋이 프로젝트의 flake8 린팅을 black 코드 포맷팅으로 교체하고 Python 코드베이스를 재포맷했습니다 — 약 14개월간 공개 커밋이 없던 후에 이루어진 기능 출시가 아닌 유지보수 작업이었습니다. - 42026년 2월 — LLM/채팅 지원 제거
Why it matters: "README: drop LLM/chat references"라는 제목의 커밋은 "We no longer support that. People can run ollama next to WIS."라고 명확히 밝혔습니다. 이는 프로젝트의 최근 역사에서 가장 중요한 변화로, WIS의 범위를 통합 ASR/TTS/LLM 서버에서 ASR/TTS 전용 서버로 좁혔으며, 이 리뷰 작성 시점 기준 저장소 main 브랜치의 가장 최근 커밋입니다.
Willow Inference Server로 무엇을 할 수 있나요?
Willow Inference Server의 기능은 범용 언어 모델 채팅보다는 빠르고 셀프호스팅되는 음성 처리에 중점을 둡니다. 다음은 프로젝트 자체의 GitHub README에 따라 각 기능이 실제로 하는 일입니다.
- 자동 음성 인식(ASR) — Whisper 기반 모델을 사용해 말한 오디오를 텍스트로 전사하며, 배치 전사뿐 아니라 "가능한 한 실시간에 가까운" 스트리밍 인식에 맞춰 프로젝트가 조정함
- 여러 Whisper 모델 크기 동시 지원 — README에 따르면 기본 Whisper 모델 크기 3종(base, medium, large-v2)을 6GB VRAM 안에서 동시에 로드할 수 있어, 하나의 모델 크기에 고정하지 않고 요청마다 정확도와 속도를 조절할 수 있음
- 음성 클로닝을 지원하는 텍스트 음성 변환(TTS) — 번들된 XTTS 기반 파이프라인을 통해 텍스트로부터 음성을 합성하며, 비교적 짧은 샘플 녹음에서 맞춤 음성을 만드는 기능을 지원함
- 다중 프로토콜 접근 — WebRTC(저대역폭 실시간 오디오 스트리밍용), REST, WebSocket을 통해 접근할 수 있어 클라이언트가 사용 사례에 맞는 전송 방식을 선택할 수 있음
- 하드웨어 자동 감지 — 서버는 사용 가능한 하드웨어를 자동으로 감지하고 그에 맞춰 동작을 조정한다고 문서화되어 있으며, GPU 모델별 수동 설정이 필요하지 않음
- Willow 음성 비서 백엔드 — WIS는 오픈소스 음성 비서 하드웨어 프로젝트 Willow가 연결하는 추론 백엔드로, 말한 명령을 텍스트로, 선택적으로 응답을 다시 음성으로 변환함
사용 예시: Willow Inference Server를 활용하는 세 가지 방법
아래는 위에서 문서화한 Willow Inference Server의 기능을 바탕으로 한 구체적인 워크플로이며, 가상의 사용 사례가 아닙니다.
Willow Inference Server 설치
Willow Inference Server는 Docker Compose로 설치하며, 소스코드는 GitHub에 있습니다. 아래 링크와 명령은 공식 GitHub 저장소에서 가져온 것입니다 — 설치 안내는 커밋마다 바뀔 수 있으니 항상 해당 페이지에서 직접 확인하세요.
GitHub 저장소(소스코드, Apache 2.0)
저장소 클론
- 링크:
git clone https://github.com/toverainc/willow-inference-server.git
GPU 배포
- 링크:
- 저장소의
docker-compose.yml파일로docker compose up
CPU 전용 배포
- 링크:
docker compose -f docker-compose-cpu.yml up(GPU보다 훨씬 느리다고 문서화됨)
Willow 음성 비서 프로젝트
- 링크:
- github.com/toverainc — WIS가 원래 지원하기 위해 만들어진 Willow 하드웨어/펌웨어 프로젝트를 포함한 모기관의 다른 저장소들
Willow Inference Server가 문서화된 성능을 내려면 CUDA 지원 NVIDIA GPU가 필요합니다 — 명시된 최소 사양은 GTX 1060 3GB이며, ASR과 TTS를 함께 실행하려면 약 6GB VRAM을 권장합니다. CPU 전용 Docker Compose 경로도 존재하고 저장소에 문서화되어 있지만, 프로젝트는 CPU 성능이 나열된 모든 GPU보다 크게 뒤처진다고 명시합니다. CPU 전용 모드는 테스트용 기능적 대체 수단으로만 여기고, 프로덕션 배포 목표로 삼지 마세요.
Willow Inference Server 가격: 정말 무료인가?
네 — Willow Inference Server에는 유료 플랜이 없습니다. GitHub 저장소에는 가격 페이지가 없으며, LICENSE.md 파일이 애플리케이션 전체에 적용됩니다. 라이선스 텍스트는 Apache License, Version 2.0으로 — 관대한 라이선스이며, 특허 부여가 포함되고 자신의 수정본을 공개해야 하는 카피레프트 의무는 없습니다.
- 구독 없음, 유료 플랜 없음, Willow Inference Server 자체가 부과하는 사용 제한 없음
- 소프트웨어를 배포하거나 사용하는 데 계정이나 가입이 필요하지 않음
- WIS를 운영하려면 여전히 자신의 GPU 하드웨어와 그것을 구동하는 전기/호스팅 비용이 필요합니다 — 소프트웨어 자체는 무료지만, 셀프호스팅은 호스팅 API처럼 완전히 비용이 없지는 않습니다
- Tovera는 별도의 음성 비서 하드웨어 프로젝트 Willow를 위한 호스팅 예제 서버도 운영합니다 — 이 리뷰는 특히 무료로 운영할 수 있는 셀프호스팅 WIS 소프트웨어를 다룹니다. 별도 호스팅 제공 서비스와 그 자체 비용 여부에 대한 세부 사항은 Tovera에 직접 확인하세요
Willow Inference Server vs. whisper.cpp
Willow Inference Server와 whisper.cpp는 모두 OpenAI의 Whisper 음성 인식 모델을 로컬에서 실행합니다. 둘 다 클라우드 API로 오디오를 보내지 않기 때문에 자주 비교됩니다. 가장 뚜렷한 차이는 배포 모델과 범위에 있습니다.
항목 | WIS | whisper.cpp |
|---|---|---|
| 범위 | WebRTC/REST/WS 지원 ASR + TTS 서버 | ASR(전사)만, 서버/TTS 없음 |
| 배포 | Docker Compose, GPU 중심 | 컴파일된 바이너리/라이브러리, CPU 친화적 |
| 대상 하드웨어 | NVIDIA CUDA GPU(3–6GB+ VRAM) | CPU에서 실행; GPU 가속은 선택 사항 |
| 실시간 스트리밍 | WebRTC로 지원하도록 설계됨 | 추가 클라이언트 작업으로 가능 |
| 하드웨어 통합 | Willow 백엔드로 설계됨 | 범용 라이브러리, 전용 하드웨어 연동 없음 |
| 유지보수 속도 | 단속적; 최근 커밋은 26년 2월 | 활발히 유지보수됨, 잦은 커밋 |
WebRTC 스트리밍과 TTS가 내장된 완성형 서버를 우선시하고 여유 있는 NVIDIA GPU가 있다면, Willow Inference Server의 기능 세트가 둘 중 더 폭넓습니다. 자체 애플리케이션에 내장할 수 있는 가능한 한 가볍고 CPU 친화적인 전사 라이브러리를 우선시한다면 whisper.cpp를 직접 검토할 가치가 있습니다 — 자세한 내용은 whisper.cpp 리뷰를 참고하세요.
Willow Inference Server는 누구에게 적합한가?
Willow Inference Server가 적합한지는 호환되는 NVIDIA GPU를 보유하고 있는지, 하나의 서버에서 ASR과 TTS가 모두 필요한지, 그리고 지속적이지 않고 단속적으로 업데이트를 출시하는 프로젝트를 받아들일 수 있는지에 달려 있습니다.
Willow Inference Server vs. 다른 음성 도구
Willow Inference Server는 로컬 음성 인식 및 합성을 위한 여러 셀프호스팅 옵션 중 하나입니다. 이 분야의 다른 도구들과 비교하면 다음과 같습니다 — 전체 카탈로그는 로컬 AI 소프트웨어 디렉터리를, 가장 가까운 일대일 비교는 위의 전용 Willow Inference Server vs. whisper.cpp 비교를 참고하세요.
- whisper.cpp — OpenAI Whisper를 전사 전용으로 이식한 가볍고 CPU 친화적인 C/C++ 구현으로, 내장 서버, WebRTC, TTS가 없음; 위의 전용 비교 섹션 참고.
- Faster Whisper — 추론 속도에 중점을 둔 CTranslate2 기반 Whisper 재구현으로, WIS 같은 완성형 ASR/TTS 서버가 아니라 내장용 라이브러리.
- Piper TTS — 가볍고 CPU 친화적인 로컬 텍스트 음성 변환 엔진으로, WIS의 통합 ASR+TTS 서버보다 범위는 좁지만 하드웨어 요구 사항은 훨씬 가벼움.
- Coqui TTS — 음성 클로닝을 지원하는 오픈소스 텍스트 음성 변환 툴킷으로, TTS 범위는 WIS가 번들한 XTTS 파이프라인과 비슷하지만 WebRTC 지원 서버가 아니라 라이브러리 형태로 배포됨.
- Bark TTS — 웃음이나 멈춤 같은 비언어 오디오도 만들 수 있는 생성형 텍스트 음성 변환 모델로, WIS가 번들한 XTTS 파이프라인과는 다른 TTS 엔진 선택지.
- MacWhisper — Whisper 전사를 위한 네이티브 macOS 데스크톱 앱으로, WIS의 서버/WebRTC 배포 모델이 전혀 필요 없는 사용자를 위한 GUI 데스크톱 대안.
Willow Inference Server 평가 시 흔한 오해
Willow Inference Server에 대한 혼란 대부분은 LLM 지원에 대한 오래된 설명, 불명확한 하드웨어 기대치, 또는 현재 업데이트가 얼마나 활발한지에 대한 과대평가에서 비롯됩니다.
자주 묻는 질문
Willow Inference Server란 무엇인가요?
Willow Inference Server(WIS, github.com/toverainc/willow-inference-server)는 Whisper 기반 음성 인식과 텍스트 음성 변환을 실행하는 무료 오픈소스 셀프호스팅 서버로, WebRTC, REST, WebSocket을 통해 접근할 수 있습니다. Tovera가 음성 비서 하드웨어 프로젝트 Willow의 백엔드로 개발했습니다.
Willow Inference Server는 무료인가요?
네. GitHub 저장소에는 가격 페이지가 없으며, LICENSE.md 파일은 Apache License 2.0으로 애플리케이션 전체에 유료 플랜 없이 적용됩니다. 운영하려면 여전히 자신의 GPU 하드웨어를 마련하고 비용을 부담해야 합니다.
Willow Inference Server는 LLM/채팅 추론을 지원하나요?
이 리뷰 작성 시점 기준으로는 지원하지 않습니다. 2026년 2월 커밋이 프로젝트에서 일반 LLM/채팅 지원을 제거했으며, 관리자들은 "We no longer support that. People can run ollama next to WIS."라고 밝혔습니다. Willow Inference Server는 현재 ASR/TTS 전용 서버입니다.
Willow Inference Server에는 어떤 GPU가 필요한가요?
CUDA 지원 NVIDIA GPU가 필요합니다. 프로젝트는 실질적인 최소 사양으로 GTX 1060 3GB를 문서화하며, 기본 Whisper 모델 크기 3종(base, medium, large-v2)과 TTS를 함께 실행하려면 약 6GB VRAM을 권장합니다. CPU 전용 Docker Compose 경로도 존재하지만 훨씬 느리다고 문서화되어 있습니다.
Willow Inference Server는 어떻게 설치하나요?
GitHub 저장소를 클론한 뒤, GPU 배포에는 제공된 docker-compose.yml로 docker compose up을, CPU 전용 경로에는 docker compose -f docker-compose-cpu.yml up을 실행하세요. 안내는 커밋마다 바뀔 수 있으므로 설치 전 저장소에서 직접 최신 안내를 확인하세요.
Willow Inference Server는 활발히 유지보수되고 있나요?
커밋 이력은 지속적인 개발이 아니라 몇 개월씩의 공백을 사이에 둔 활동 급증을 보여줍니다 — 예를 들어 2024년 4월부터 2025년 6월 사이에 약 14개월간 공개 커밋이 없었습니다. 이 리뷰 작성 시점 기준으로 main 브랜치의 가장 최근 커밋은 2026년 2월 자이며, 저장소에는 태그가 붙은 릴리스가 없습니다. 아카이브되지는 않았지만, 지속적인 릴리스 속도를 가진 프로젝트라기보다 커뮤니티 속도로 진행되는 소규모 프로젝트입니다.
Willow Inference Server와 Willow는 어떤 관계인가요?
Willow는 마찬가지로 Tovera가 유지관리하는 별도의 오픈소스 음성 비서 하드웨어/펌웨어 프로젝트입니다. Willow Inference Server는 Willow 기기의 음성을 처리하는 백엔드 소프트웨어이지만, 다른 음성-텍스트 또는 텍스트-음성 변환 용도로도 독립적으로 실행할 수 있습니다.
Willow Inference Server는 TTS용 맞춤 음성을 클로닝할 수 있나요?
네. 프로젝트 문서에 따르면 번들된 XTTS 기반 TTS 파이프라인은 비교적 짧은 샘플 녹음에서 맞춤 음성 프로필을 만드는 기능을 지원합니다.
Willow Inference Server는 어떤 라이선스를 사용하나요?
공식 LICENSE.md 파일에 따르면 Apache License, Version 2.0입니다 — 관대한 라이선스이며, 특허 부여가 포함되고 자신의 수정본을 오픈소스로 공개해야 할 의무는 없습니다.
Willow Inference Server는 실시간 스트리밍을 지원하나요?
네, WebRTC를 통해 지원합니다. 프로젝트는 명령을 계속 듣는 음성 비서 같은 저지연 실시간 오디오 사용 사례를 위해 이를 특별히 구축했습니다. 스트리밍이 필요 없거나 더 간단한 통합을 위한 REST 및 WebSocket 엔드포인트도 제공됩니다.