Skip to main content
PromptQuorum
主页/本地LLM进阶/Parlor评测:设备端实时语音与视觉AI
Voice, Speech & Multimodal

Parlor评测:设备端实时语音与视觉AI

·阅读约10分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

Parlor是一款免费、开源、设备端实时运行的AI助手,能够进行语音对话并对摄像头看到的内容做出反应,完全运行在搭载Apple Silicon的Mac或配备受支持GPU的Linux设备上——而非依赖云端语音API。 它由一名独立开发者打造,作为研究预览版发布,将本地视觉语言模型(Gemma 4,通过llama.cpp运行)与本地语音轮次检测、文本转语音功能结合在一起,除非你主动启用可选的云端研究功能,否则始终完全在设备端运行。

Parlor(github.com/fikrikarim/parlor)是一款免费、开源、设备端实时运行的多模态AI助手,通过麦克风聆听、通过摄像头观察并进行语音回应——完全运行在Mac或Linux设备上,而非依赖云端语音API。它是由个人开发者独立打造的研究预览版,而非成熟的商业产品,GitHub星标数超过2,000。本评测介绍它的功能、级联管线的工作原理、硬件要求,以及适合哪些人使用。

关键要点

  • Parlor(github.com/fikrikarim/parlor)是一款免费、开源、设备端实时运行的多模态AI助手——属于研究预览版,而非成品
  • 由开发者Fikri Karim创建,他还打造过另一个名为Bule AI的托管式语音AI项目;在体验了OpenAI的GPT-Live之后,他希望有一个完全本地化的替代方案,由此诞生了Parlor
  • 采用Apache 2.0许可,通过GitHub仓库的LICENSE文件确认
  • 通过llama.cpp运行Gemma 4(Google DeepMind),默认使用E4B变体,用于同时理解语音和视觉内容
  • 截至本次评测,GitHub星标超过2,000,fork数为271
  • 目前共有两个带标签的发布版本:v1.0.0(2026年7月29日)和v2.0.0(2026年8月2日)

📍 简单一句话

Parlor是一款免费、开源、设备端实时运行的语音与视觉AI助手,由一名独立开发者作为研究预览版打造,通过llama.cpp在搭载Apple Silicon的Mac或配备受支持GPU的Linux设备上运行Gemma 4,GitHub星标数超过2,000。

💬 简单来说

Parlor是一款你自己安装并运行的软件,让你可以对着AI助手说话,还可以选择让摄像头一起"观察",默认情况下全部在你自己的电脑上运行——没有云端语音订阅、没有账户,也不按分钟计费(除非你启用可选的云端研究功能)。由于它在本地运行AI模型,需要一台配备GPU、性能相当不错的Mac或Linux设备。

📌: 本评测基于Parlor自身的GitHub仓库、其README文件以及通过GitHub API获取的发布历史。本评测不声称PromptQuorum独立复现了Parlor公布的延迟基准测试——这些数据是该项目自己的测量结果,在Apple M3 Pro上得出。

Parlor是什么?

Parlor是一款免费、开源的研究预览版,是完全在设备端实时运行的AI助手,能够聆听、通过摄像头观察并进行语音回应——在概念上与OpenAI的GPT-Live类似,但在本地而非云端运行。 其README明确将它标注为"研究预览版",并提醒用户会遇到不完善之处和错误。

  • 产品类型:一款自托管的本地Web应用——你在自己的设备上运行服务器,并在浏览器中打开它
  • 创建者:开发者Fikri Karim独立开发;README中指出代码库是"在Claude的大力协助下编写的,由人类主导创意、测试和调试"
  • 仓库:github.com/fikrikarim/parlor,创建于2026年4月5日
  • 许可:Apache 2.0,通过仓库的LICENSE文件确认
  • 资金:本评测未发现Parlor获得融资轮次、投资者或商业支持的证据——应将Parlor视为一个独立的个人开发者研究项目,而非获得融资的公司
  • 规模:截至本次评测,GitHub星标超过2,000,fork数为271

Parlor实际是如何工作的?

Parlor采用级联管线,而非单一的端到端语音模型:你的浏览器通过WebSocket将麦克风音频和摄像头画面流式传输到本地FastAPI服务器,服务器将语音轮次检测、视觉语言模型和文本转语音作为独立阶段依次运行。

  • 语音轮次检测:浏览器端的Silero VAD先标记静音,随后由Pipecat的smart-turn-v3模型(约20毫秒)判断你是否真正说完,这样句子中间的停顿就不会被误判为已经说完
  • 理解与生成:Gemma 4(Google DeepMind,默认使用E4B变体)通过llama.cpp运行,采用QAT 4位量化,同时处理音频和摄像头画面,并以流式方式生成回复
  • 操作处理:由同一模型发起一个独立的、强制JSON格式的请求,用于决定计时器、模式切换或研究请求,因此控制指令不会混入语音回复中
  • 语音输出:Kokoro文本转语音(macOS上使用MLX后端,Linux上使用ONNX)在模型仍在生成内容时,就逐句朗读回复
  • 打断功能:你可以在Parlor说话时插话打断它——生成过程会在服务器端被中止,而不只是静音播放
  • 可选云端研究:如果你设置了REASONER_API_KEY,Parlor可以将开放式的研究问题(例如"现在找一家罗马最好的披萨店")通过兼容OpenAI的端点(如OpenRouter)转交给前沿模型处理,同时本地对话继续进行;如果未设置该密钥,Parlor将始终完全在设备端运行

Parlor实际能做什么?

Parlor支持免提语音对话,并可选接入摄像头输入,此外还提供几种针对特定任务的命名模式。

  • 免提对话:没有按键说话按钮——Parlor会自行检测你何时开始和结束说话
  • 感知摄像头的回答:将摄像头对准某个物体并提问;画面会与你的语音一起流式传输给同一个本地模型
  • 计时器:"给意大利面设一个三分钟的计时器"——倒计时由服务器本身负责(而非语言模型),因此即使在静默轮次中计时器也会照常响铃,屏幕上还会显示一个可取消的倒计时标签
  • 实时翻译模式:说"把我说的话都翻译成英语",Parlor就会变成一名交替传译员,在短暂停顿后逐句翻译,支持Gemma 4能理解的任何语言,直到你说"停止翻译"为止
  • 仅聆听模式:说"先听一会儿,我想大声思考",Parlor会将所有内容转录到屏幕上而不做语音回应,直到你再次对它说话为止
  • 后台研究:配置可选的云端API密钥后,Parlor可以在本地对话继续进行的同时,将开放式查询问题委托给另一个模型处理,并在得到答案后语音播报

平台、定价与许可

平台

Parlor的说明:
一款自托管的本地Web应用,通过浏览器访问。可运行在搭载Apple Silicon的macOS或配备受支持GPU的Linux上,没有Windows版本。

费用

Parlor的说明:
免费且开源,无需订阅,无需账户。默认所有AI处理都在本地进行;可选的云端研究功能需要你自行为另一家服务商提供API密钥。

许可

Parlor的说明:
Apache 2.0,通过GitHub仓库的LICENSE文件确认。

硬件

Parlor的说明:
默认的Gemma 4 E4B模型大约需要6 GB可用内存;较小的E2B变体约需4 GB即可运行;更大的12B版本则约需8 GB。

状态

Parlor的说明:
其自身README中明确标注为"研究预览版"——据该项目自述,会存在不完善之处和错误。

安装前请直接前往github.com/fikrikarim/parlor核实当前的硬件和平台要求,因为研究预览版可能会在不同版本之间发生变化。

Parlor vs. Voxa

Parlor和Voxa都是开源的实时语音助手,但Parlor刻意设计为纯本地运行,而Voxa在设计上则是混合式的。

处理位置

Parlor:
默认仅在设备端处理;云端研究功能需主动开启,且与对话本身相互独立
Voxa:
混合式——将对话路由至云端实时模型(Gemini Live、OpenAI Realtime)或你自行配置的自托管本地守护进程

摄像头输入

Parlor:
支持——摄像头画面与语音一起输入同一个模型,实现具备视觉感知的回答
Voxa:
根据其自身文档,不属于其核心功能集

平台支持

Parlor:
搭载Apple Silicon的macOS,或配备受支持GPU的Linux;没有Windows版本
Voxa:
使用Tauri v2构建的桌面应用,得益于该框架的设计而支持跨平台

界面

Parlor:
基于浏览器的本地Web应用
Voxa:
一个无边框、始终置顶的悬浮球,点击即可开始对话

成熟度

Parlor:
明确标注为"研究预览版";截至本次评测共有两个带标签的发布版本
Voxa:
定位为可用的桌面助手,而非标注为研究预览版

两者都是开源且免费的。如果你想要在Mac或Linux上获得具备摄像头感知、默认完全本地处理的体验,可以选择Parlor;如果你想要更轻量的桌面悬浮球,并保留回退到云端实时语音模型的选项,可以选择Voxa。详见Voxa评测

谁应该使用Parlor?

Parlor适合使用Mac或Linux、具备一定技术能力、希望体验完全本地化、支持摄像头感知的语音助手,并能够容忍研究预览版不完善之处的用户。

Parlor不适合什么场景

如果你需要Windows支持、一键安装,或是需要稳定的生产工具而非持续演进的研究预览版,Parlor并不适合你。

  • 不适合Windows用户——仅支持搭载Apple Silicon的macOS或配备受支持GPU的Linux
  • 不是打包的一键安装应用——安装需要终端、Python 3.12+、uv以及可正常运行的llama.cpp构建
  • 不是成熟的、带版本号的成品——其自身README将它称为研究预览版,并提醒用户会遇到错误
  • 不支持多用户,也不面向他人托管——它的设计目的是供一个人在自己的设备上本地运行
  • 本评测未能核实到任何公司或融资轮次的支持——应将它视为一个由个人开发者独立维护的项目

评估Parlor时的常见误区

关于Parlor的大多数困惑,源于期望它是成熟的商业产品,或低估了它的硬件和平台要求。

竞品与替代方案

Parlor最适合与其他开源、实时语音及个人助手项目相比较,这些项目都强调本地或混合处理,而非纯粹的云端订阅。

Tool
Best known for
Link
Voxa开源桌面语音助手悬浮球,混合本地/云端实时语音路由Voxa评测
Jarvis (Mac)面向Mac的语音助手应用,围绕本地及可配置AI后端打造Jarvis Mac评测
nanobot自托管的个人AI代理,具备持久记忆,以文本为主而非以语音为主nanobot评测
OpenAI GPT-Live基于云端订阅的实时语音产品,被指出是Parlor的灵感来源openai.com/index/introducing-gpt-live

此列表反映了在本地语音助手领域常与Parlor比较的工具,并非PromptQuorum的独立排名——选择之前请核实每款工具当前的平台支持和功能集。

常见问题

Parlor是什么?

Parlor(github.com/fikrikarim/parlor)是一款免费、开源(Apache 2.0)的研究预览版,是设备端实时运行的语音与视觉AI助手,由一名独立开发者打造,可完全运行在Mac或Linux设备上。

Parlor是免费的吗?

是的,Parlor免费且开源。它不需要订阅或账户。如果你选择启用可选的后台研究功能,则需要自行提供另一家云服务商的API密钥。

Parlor支持Windows吗?

不支持。Parlor需要搭载Apple Silicon的macOS或配备受支持GPU的Linux。没有Windows版本。

Parlor会将我的语音或摄像头数据发送到云端吗?

默认情况下不会——麦克风音频和摄像头画面都通过运行在你自己设备上的模型在本地处理。只有当你主动设置REASONER_API_KEY以启用可选的后台研究功能时,数据才会离开你的设备。

如何安装Parlor?

克隆GitHub仓库,安装uv Python包管理器和llama.cpp,然后依次运行uv syncuv run parlor。在浏览器中打开http://localhost:8000,并授予摄像头和麦克风权限。

Parlor使用什么AI模型?

来自Google DeepMind的Gemma 4,通过llama.cpp在本地运行——默认使用E4B变体,此外根据硬件情况还可选择更小的(E2B)或更大的(12B)版本。

Parlor是谁创建的?

开发者Fikri Karim独立打造了Parlor这款研究预览版,此前他还自托管过另一个名为Bule AI的始终在线语音AI项目。

Parlor需要多少内存?

默认的E4B模型配置大约需要6 GB可用内存;较小的E2B变体约需4 GB即可运行,更大的12B版本则约需8 GB。

Parlor能通过我的摄像头"看到"东西吗?

可以。你可以将摄像头对准某个物体并向Parlor提问——摄像头画面会与你的语音一起流式传输给同一个本地模型。

Parlor是成品吗?

不是。其自身README明确将它标注为"研究预览版",并要求用户预期会遇到不完善之处和错误。目前共有两个带标签的发布版本。

信息来源

← 返回 本地LLM进阶