Skip to main content
PromptQuorum
主页/本地LLM进阶/Willow Inference Server评测2026:自托管Whisper ASR与TTS
Voice, Speech & Multimodal

Willow Inference Server评测2026:自托管Whisper ASR与TTS

·阅读时间11分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

Willow Inference Server是Tovera开发的一款免费开源、自托管的语音推理服务器(源代码见github.com/toverainc/willow-inference-server),通过WebRTC、REST和WebSocket提供基于Whisper的语音转文本和文本转语音服务。 它没有付费套餐:GitHub上的LICENSE文件采用Apache License 2.0。Willow Inference Server通过Docker Compose在Linux上运行(Windows通过WSL),基础使用需要一块支持CUDA的NVIDIA GPU,最低仅需3GB显存(同时运行ASR和TTS建议6GB),最初是作为开源语音助手硬件项目Willow的后端构建的——不过截至本评测时,它已不再支持通用的LLM/聊天推理,该功能已于2026年2月被项目自身的维护者移除。

Willow Inference Server(WIS,github.com/toverainc/willow-inference-server)是Tovera开发的一款免费开源、自托管的语音服务器,通过WebRTC、REST和WebSocket提供基于Whisper的语音识别(ASR)和文本转语音(TTS)服务。它最初是为开源语音助手硬件项目Willow构建的后端,也可以在自己的GPU上独立运行。本评测介绍Willow Inference Server的实际功能、Docker安装步骤、真实硬件要求以及当前的维护状态。

关键要点

  • Willow Inference Server免费且开源;官方GitHub LICENSE采用Apache License 2.0
  • 运行基于Whisper的自动语音识别(ASR)和文本转语音(TTS),可通过WebRTC、REST和WebSocket访问
  • 通过Docker Compose部署在Linux上(Windows通过WSL);同时提供纯CPU的Docker Compose文件,但文档说明CPU性能明显慢于GPU
  • 可在从GTX 1060 3GB到RTX 4090的NVIDIA GPU上运行;同时运行所有默认Whisper模型尺寸加TTS大约建议使用6GB显存
  • 支持从相对简短的示例录音创建自定义TTS语音
  • Tovera开发,作为开源语音助手硬件项目Willow的后端
  • 不再支持通用LLM/聊天推理——该功能已在2026年2月的一次提交中明确移除;项目自身的维护者建议用户搭配运行Ollama等独立工具来满足这一需求
  • 截至2026年9月,GitHub仓库(github.com/toverainc/willow-inference-server)显示约510颗星;提交活动呈阵发性而非持续性——应将其视为一个规模较小、节奏较慢的项目,而非人手充足的商业项目

📍 简单一句话

Willow Inference Server是一款免费开源、自托管的服务器,可在你自己的NVIDIA GPU上运行基于Whisper的语音识别和文本转语音,完全没有付费套餐。

💬 简单来说

Willow Inference Server不会把你的语音录音发送到云端语音API,而是在你自己掌控的电脑(通常配备NVIDIA显卡)上运行语音转文本和文本转语音的模型。它最初为驱动Willow语音助手硬件项目而构建,但也可以独立运行,服务于任何需要在不依赖云端的情况下将语音转文本或文本转语音的应用。

📌: 本评测是本地AI软件目录中Willow Inference Server条目的深度版本——请查看该页面,了解它与其他数十款本地AI工具的一览对比。

Willow Inference Server是什么?

Willow Inference Server是一款自托管服务器,可在你自己的硬件上运行语音识别和语音合成模型,并通过WebRTC、REST和WebSocket访问。官方GitHub描述写道:"Open source, local, and self-hosted highly optimized language inference server supporting ASR/STT, TTS, and LLM across WebRTC, REST, and WS"——本评测发现这一描述如今已部分过时,因为通用LLM支持已于2026年2月从代码库中移除(见下文历史部分)。截至本评测时,WIS准确的定位应是ASR/TTS服务器,而非通用LLM服务器。

  • 核心功能:通过WebRTC、REST或WebSocket接收音频或文本,并返回转录文本或合成音频的语音推理服务器
  • 语音识别引擎:OpenAI的Whisper模型,经项目调优以适配低延迟流式场景
  • 文本转语音引擎:内置的TTS流水线(仓库包含专用的Dockerfile.xttsxtts目录),支持从简短示例录音创建自定义语音
  • 部署目标:支持CUDA的NVIDIA GPU,同时提供已文档化的纯CPU回退路径(性能较低)
  • 开发方:Tovera,开源语音助手硬件项目Willow背后的组织
  • 权威仓库:github.com/toverainc/willow-inference-server——目前活跃使用的项目及组织名称,承载服务器的源代码、发布记录和问题跟踪

Willow Inference Server项目历史

Willow Inference Server的GitHub仓库创建于2023年2月,其提交历史显示出活动呈阵发式,中间穿插着长时间的沉寂期,而非持续的每周开发——这是在生产环境中依赖它之前值得了解的一种模式。

  1. 1
    2023年2月 — 仓库创建
    Why it matters: Willow Inference Server最初作为语音助手硬件项目Willow的后端配套项目启动,该项目同样由Tovera组织维护。
  2. 2
    2024年4月 — TTS引擎更新
    Why it matters: 根据仓库的提交历史,这一时期的提交更新了内置的XTTS语音克隆流水线。
  3. 3
    2025年6月 — 代码质量整理
    Why it matters: 一批提交将项目的flake8代码检查替换为black代码格式化,并重新格式化了Python代码库——这是一次维护性整理,而非功能发布,之前大约14个月没有公开提交。
  4. 4
    2026年2月 — 移除LLM/聊天支持
    Why it matters: 一次题为"README: drop LLM/chat references"的提交明确指出:"We no longer support that. People can run ollama next to WIS."(我们不再支持该功能,用户可以在WIS旁边运行ollama。)这是该项目近期历史上影响最大的变化——它将WIS的范围从综合的ASR/TTS/LLM服务器收窄为仅限ASR/TTS的服务器,也是截至本评测时仓库main分支上最新的提交。

Willow Inference Server能做什么?

Willow Inference Server的功能集中于快速的自托管语音处理,而非通用的语言模型聊天。以下是根据项目自身的GitHub README,各部分实际的功能。

  • 自动语音识别(ASR) — 使用基于Whisper的模型将口语音频转录为文本,项目调优目标是"尽可能接近实时"的流式识别,而不仅仅是批量转录
  • 同时支持多个Whisper模型尺寸 — README说明,三种默认Whisper模型尺寸(base、medium、large-v2)可以同时加载在6GB显存内,使部署能够按请求在准确性和速度之间权衡,而不必固定使用某一种模型尺寸
  • 支持语音克隆的文本转语音(TTS) — 通过内置的基于XTTS的流水线从文本合成语音,支持从相对简短的示例录音创建自定义语音
  • 多协议访问 — 可通过WebRTC(用于低带宽实时音频流)、REST和WebSocket访问,客户端可以选择适合自身用例的传输方式
  • 硬件自动检测 — 文档说明服务器会自动检测可用硬件并相应调整行为,而无需针对每种GPU型号手动配置
  • Willow语音助手后端 — WIS是开源语音助手硬件项目Willow所连接的推理后端,用于将语音指令转为文本,并可选地将回应再转回语音

使用示例:Willow Inference Server的三种用法

以下是基于上述Willow Inference Server已文档化功能构建的具体工作流——而非假设性用例。

Willow Inference Server价格:真的免费吗?

是的——Willow Inference Server没有付费套餐。 GitHub仓库没有定价页面,LICENSE.md文件适用于整个应用程序。许可证文本为Apache License,Version 2.0——宽松许可,附带专利授权,且没有要求发布你自己修改版本的著佐权(copyleft)义务。

  • 没有订阅、没有付费套餐、Willow Inference Server本身不施加任何使用限制
  • 部署或使用该软件无需账户或注册
  • 运行WIS仍需要你自己的GPU硬件以及运行它所需的电力/托管成本——软件本身是免费的,但自托管并不像托管API那样零成本
  • Tovera还为独立的语音助手硬件项目Willow运营着一个托管示例服务器——本评测专门覆盖自托管、免费运行的WIS软件;关于单独托管产品的任何细节及其是否产生自身费用,请直接向Tovera核实

Willow Inference Server 对比 whisper.cpp

Willow Inference Server和whisper.cpp都能在本地运行OpenAI的Whisper语音识别模型,两者经常被拿来比较,因为都避免将音频发送到云端API。最明显的区别在于部署模式和功能范围。

方面
WIS
whisper.cpp
范围ASR+TTS服务器,含WebRTC/REST/WS仅ASR(转录),无服务器/TTS
部署Docker Compose,偏重GPU编译二进制/库,适合CPU
目标硬件NVIDIA CUDA GPU(3–6+GB显存)可在CPU运行;GPU加速可选
实时流式专为此设计,通过WebRTC需额外客户端开发才能实现
硬件集成专为Willow后端设计通用库,无专属硬件绑定
维护节奏阵发性;最近提交为26年2月积极维护,提交频繁

如果你的重点是一个内置WebRTC流式和TTS的现成服务器,并且手头有闲置的NVIDIA GPU,那么Willow Inference Server的功能集更为全面。如果你的重点是尽可能轻量、适合CPU并可嵌入自己应用的转录库,whisper.cpp值得直接评估——完整细节请见whisper.cpp评测

谁适合使用Willow Inference Server?

Willow Inference Server是否适合你,取决于你是否拥有兼容的NVIDIA GPU、是否需要在一台服务器上同时具备ASR和TTS,以及你是否能接受一个更新呈阵发式而非持续发布的项目。

Willow Inference Server 对比其他语音工具

Willow Inference Server是本地语音识别与合成领域众多自托管选择之一。以下是它与该领域其他工具的对比——完整目录请见本地AI软件目录,最接近的一对一比较请见上方专门的Willow Inference Server对比whisper.cpp

  • whisper.cpp — 一个轻量、适合CPU的OpenAI Whisper的C/C++移植版,仅用于转录,不含内置服务器、WebRTC或TTS;详见上方专门的比较部分。
  • Faster Whisper — 一个基于CTranslate2、专注于推理速度的Whisper重新实现;是一个可嵌入的库,而非像WIS这样的现成ASR/TTS服务器。
  • Piper TTS — 一个轻量、适合CPU的本地文本转语音引擎;功能范围比WIS的综合ASR+TTS服务器更窄,但对硬件的要求要轻得多。
  • Coqui TTS — 一个支持语音克隆的开源文本转语音工具包,TTS功能范围与WIS内置的XTTS流水线相当,但以库的形式分发,而非WebRTC就绪的服务器。
  • Bark TTS — 一个能够生成非语音音频(笑声、停顿)的生成式文本转语音模型;与WIS内置的XTTS流水线相比是不同的TTS引擎选择。
  • MacWhisper — 一款用于Whisper转录的原生macOS桌面应用;适合完全不需要WIS服务器/WebRTC部署模式的用户的图形化桌面替代方案。

评估Willow Inference Server时的常见误区

关于Willow Inference Server的大多数困惑,源于对其LLM支持的过时描述、不明确的硬件预期,或对其当前更新活跃程度的高估。

常见问题

Willow Inference Server是什么?

Willow Inference Server(WIS,github.com/toverainc/willow-inference-server)是一款免费开源、自托管的服务器,运行基于Whisper的语音识别和文本转语音,可通过WebRTC、REST和WebSocket访问。它由Tovera开发,作为语音助手硬件项目Willow的后端。

Willow Inference Server是免费的吗?

是的。GitHub仓库没有定价页面,其LICENSE.md文件为Apache License 2.0,适用于整个应用程序,没有付费套餐。运行它仍需要你自己提供并承担GPU硬件的费用。

Willow Inference Server支持LLM/聊天推理吗?

截至本评测时不支持。2026年2月的一次提交从项目中移除了通用LLM/聊天支持,维护者表示:"We no longer support that. People can run ollama next to WIS."Willow Inference Server目前仅是一款ASR/TTS服务器。

Willow Inference Server需要什么GPU?

一块支持CUDA的NVIDIA GPU。项目文档说明实际可用的最低配置为GTX 1060 3GB,同时运行三种默认Whisper模型尺寸(base、medium、large-v2)加TTS建议使用约6GB显存。存在纯CPU的Docker Compose路径,但文档说明明显更慢。

如何安装Willow Inference Server?

克隆GitHub仓库,对于GPU部署使用提供的docker-compose.yml运行docker compose up,对于纯CPU路径运行docker compose -f docker-compose-cpu.yml up。安装前请直接查看仓库获取最新说明,因为这些说明可能随提交而变化。

Willow Inference Server是否得到积极维护?

其提交历史显示活动呈阵发式,中间穿插数月间隔,而非持续开发——例如2024年4月到2025年6月之间约14个月没有公开提交。截至本评测时,main分支上最新的提交来自2026年2月,仓库没有任何打标签的发布版本。它并未被归档,但这是一个按社区节奏推进的较小项目,而非拥有持续发布节奏的项目。

Willow Inference Server和Willow之间是什么关系?

Willow是一个独立的开源语音助手硬件/固件项目,同样由Tovera维护。Willow Inference Server是为Willow设备处理语音的后端软件,但也可以独立运行,用于其他语音转文本或文本转语音的用例。

Willow Inference Server能为TTS克隆自定义语音吗?

可以。根据项目文档,其内置的基于XTTS的TTS流水线支持从相对简短的示例录音创建自定义语音配置文件。

Willow Inference Server使用什么许可证?

根据官方LICENSE.md文件,采用Apache License,Version 2.0——宽松许可,附带专利授权,且不要求将你自己的修改开源发布。

Willow Inference Server支持实时流式传输吗?

支持,通过WebRTC实现,该项目专门为低延迟实时音频用例构建,例如持续监听指令的语音助手。REST和WebSocket端点也可用于非流式或更简单的集成场景。

资料来源

← 返回 本地LLM进阶