Skip to main content
PromptQuorum
主页/本地LLM进阶/RunAnywhere评测2026:支持LLM、STT、TTS和VAD的设备端AI SDK
Overview & Reference

RunAnywhere评测2026:支持LLM、STT、TTS和VAD的设备端AI SDK

·阅读约12分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

RunAnywhere是一款设备端AI SDK——它是一个库,而非独立应用——开发者将其集成到iOS、Android、macOS、Windows、Flutter、React Native或Web应用中,以在用户设备上完全本地运行LLM聊天、语音转文本、文本转语音、语音活动检测和视觉语言模型。 其核心运行时和原生SDK均在自定义的"RunAnywhere License"下发布,项目方将其描述为"基于Apache 2.0,附加商业使用条款":对个人、教育机构、非营利组织、政府机构、经OSI批准的开源项目,以及融资额低于100万美元且年收入低于100万美元的组织免费;规模更大的商业组织需要向RunAnywhere, Inc.购买付费许可。截至本评测撰写时,其GitHub仓库(github.com/RunanywhereAI/runanywhere-sdks)已获得约10,300个星标。

RunAnywhere(runanywhere.ai,源代码位于github.com/RunanywhereAI/runanywhere-sdks)是一个软件开发工具包(SDK),用于构建AI功能——语言模型聊天、语音转文本(STT)、文本转语音(TTS)、语音活动检测(VAD)、视觉语言模型和嵌入(embeddings)——这些功能完全在终端用户自己的设备上运行,而不是每次请求都调用云端服务器。与本目录中其他章节介绍的聊天应用和桌面工具不同,RunAnywhere不是你自己下载并打开使用的东西:它是开发者集成到自己的iOS、Android、Flutter、React Native或Web应用中的一个库。本评测将介绍该SDK的实际功能、安装方法、其许可条款(比简单的"开源"标签要复杂得多)以及它在其他设备端推理工具中的定位。

RunAnywhere评测2026:支持LLM、STT、TTS和VAD的设备端AI SDK

关键要点

  • 这是一个软件开发工具包(SDK),而非可独立下载的应用——开发者实际如何将其集成到项目中,参见下方的安装与快速上手
  • 根据项目自身的GitHub README,涵盖LLM聊天、语音转文本(STT)、文本转语音(TTS)、语音活动检测(VAD)、视觉语言模型(VLM)、嵌入以及检索增强生成(RAG)
  • 运行在共享的原生C++运行时之上,配备针对硬件的专用引擎:面向Apple Silicon的MetalRT,以及面向高通Hexagon NPU的QHexRT
  • 在"RunAnywhere License"下,对个人、教育机构、非营利组织、政府机构、经OSI批准的开源项目,以及融资额低于100万美元且年收入低于100万美元的组织免费;规模更大的商业组织需要向RunAnywhere, Inc.购买付费许可——完整细节参见下方的许可与定价
  • 为Swift(iOS 17.5+/macOS 14.5+)、Kotlin(Android API 24+)、Flutter、React Native、Web(TypeScript/WASM)、Python提供原生SDK,并配有终端CLI工具(rcli
  • 截至本评测撰写时,GitHub仓库(github.com/RunanywhereAI/runanywhere-sdks)约有10,300个星标和376个分支(fork)
  • 开发方:RunAnywhere, Inc.,该公司将自身定位为"以研究为先的推理实验室",为消费级芯片手写GPU/NPU内核

📍 简单一句话

RunAnywhere是一款设备端AI SDK,开发者将其嵌入iOS、Android、Flutter、React Native和Web应用,以本地运行LLM、语音和语音检测功能,在其自定义许可下对小型组织和非商业用途免费。

💬 简单来说

与自行安装的聊天应用不同,RunAnywhere是应用开发者集成到自身软件中的工具包,让他们的应用能够直接在你的手机或笔记本电脑上运行AI功能——与模型聊天、转录语音或朗读文本,而无需向服务器发送任何内容。如果你自己不开发应用,就不会直接接触到RunAnywhere;你只会在使用它构建的应用内部遇到它。

📌: 本评测是本地LLM软件目录中RunAnywhere条目的深度解读——如需一览RunAnywhere与其他数十种本地AI工具的对比,请查阅该页面。

RunAnywhere是什么?

RunAnywhere是一款软件开发工具包,用于在应用已经运行的设备上执行AI推理,而不是每次请求都调用云端API。根据其自身的GitHub介绍,该项目将自身定位为"一个SDK,覆盖所有设备。LLM、视觉、语音、语音代理、RAG、嵌入和图像生成,均可在手机、浏览器、桌面和服务器上本地运行。"它明确面向构建自有iOS、Android、Flutter、React Native或Web应用的开发者,而非寻找可直接安装的聊天应用的普通用户。

  • 核心功能:共享的C++运行时,加上按平台划分的SDK(Swift、Kotlin、Flutter、React Native、TypeScript、Python),暴露相同的API模式以在本地运行模型
  • RunAnywhere自身文档中展示的示例API调用:RunAnywhere.llm.generate("Name three colours")——无论底层平台是Swift、Kotlin还是JavaScript,该调用结构都应保持一致
  • 开发方:RunAnywhere, Inc.,一家自称"以研究为先的推理实验室"的公司,为消费级硬件编写自有GPU和NPU内核,而不是仅依赖通用推理库
  • 规范仓库:github.com/RunanywhereAI/runanywhere-sdks——托管共享运行时及所有平台SDK包的单一代码仓库
  • 文档:docs.runanywhere.ai,提供Swift、Kotlin、React Native、Flutter、Web和Electron的分平台快速入门指南

安装与快速上手

RunAnywhere无需常规意义上的"下载"步骤——SDK本身没有安装程序,也没有应用商店条目,因为它是开发者添加到自己项目中的代码。以下命令来自RunAnywhere自身的GitHub READMEpub.dev页面——由于RunAnywhere发布版本较为频繁,请务必直接查阅这些页面以获取当前版本号。

  1. 1
    iOS / macOS(Swift)
    Why it matters: 通过Swift Package Manager添加该包,指向`https://github.com/RunanywhereAI/runanywhere-sdks`。需要iOS 17.5+或macOS 14.5+。
  2. 2
    Android(Kotlin)
    Why it matters: 添加Gradle依赖:`implementation("io.github.sanchitmonga22:runanywhere-sdk:0.20.11")`(另加`runanywhere-llamacpp`等引擎模块,用于基于llama.cpp的推理后端)。需要Android API 24+。
  3. 3
    Flutter
    Why it matters: 在`pubspec.yaml`中添加:`runanywhere: ^0.20.11`(另加`runanywhere_llamacpp: ^0.20.11`用于本地推理引擎)。包页面:[pub.dev/packages/runanywhere](https://pub.dev/packages/runanywhere)。
  4. 4
    Web(TypeScript/WASM)
    Why it matters: 通过npm安装:`npm install @runanywhere/web@0.20.11 @runanywhere/web-llamacpp@0.20.11`。使用WebAssembly在浏览器内运行,浏览器支持时可启用WebGPU加速。
  5. 5
    Python
    Why it matters: 通过pip安装:`pip install runanywhere`。面向Windows、macOS和Linux上的桌面/服务器使用场景。
  6. 6
    终端(rcli)
    Why it matters: macOS/Linux:`brew install runanywhereai/tap/rcli`,或使用安装脚本`curl -fsSL https://raw.githubusercontent.com/RunanywhereAI/RCLI/main/install.sh | sh`。Windows:`irm https://raw.githubusercontent.com/RunanywhereAI/RCLI/main/install.ps1 | iex`。

许可与定价:多数评测忽略的细节

RunAnywhere并非简单的"开源"——它以自定义许可发布,其自身仓库将该许可描述为"基于Apache 2.0,附加商业使用条款",而非未经修改的Apache License 2.0。 直接阅读SDK仓库中的LICENSE文件可知,免费使用需满足特定条件,超过一定门槛的营利性组织需要单独购买商业许可。

个人(个人、教育或非商业用途)

许可条款:
在RunAnywhere License下免费

教育机构、非营利组织、政府机构或经OSI批准的开源项目

许可条款:
在RunAnywhere License下免费

融资额低于100万美元且年收入低于100万美元的组织

许可条款:
在RunAnywhere License下免费

超过上述任一门槛的组织

许可条款:
需要向RunAnywhere, Inc.购买付费商业许可(联系方式见LICENSE文件:san@runanywhere.ai)

符合条件的组织可获得该许可第三部分的后备条款,赋予其类似Apache License 2.0的条件(永久性、全球性、非独占的使用、修改与分发权利)——但仅限于其持续符合条件期间。根据许可文本,如果一个组织最初符合条件,之后超过了100万美元融资或100万美元收入这两个门槛中的任意一个,"免费许可将在超过门槛后自动终止",并且必须在"三十(30)天内"获得商业许可。这与不附带收入条件的标准宽松开源许可有着本质区别——在依据任何摘要(包括本文)作出法律或采购决策之前,请务必自行阅读当前的LICENSE文件,因为许可条款可能在不同版本间发生变化。还有一个值得明确指出的细节:本评测无法独立确认每个特定平台的软件包(例如pub.dev上的Flutter包)是否携带与核心RunAnywhere License分开、单独界定的简单Apache 2.0许可——pub.dev上Flutter包的许可字段显示为未指定,且指向同一份仓库LICENSE文件,而非声明单独的许可。请查阅你计划使用的具体软件包所附带的LICENSE文件,而不要假设某个平台专属SDK无条件适用Apache 2.0。

用RunAnywhere能构建什么?

根据项目自身的GitHub README文档,RunAnywhere的功能集覆盖设备端AI的多个类别,均通过所支持语言中相同的API模式暴露。

  • LLM聊天与文本生成 — 在设备端运行开放权重语言模型,用于聊天、摘要或结构化生成,每次请求无需网络调用
  • 语音转文本(STT) — 在本地将语音音频转录为文本
  • 文本转语音(TTS) — 在本地根据文本生成语音音频
  • 语音活动检测(VAD) — 检测用户何时在说话,是语音代理和"按键通话"功能的基础组件
  • 视觉语言模型(VLM) — 运行可同时处理图像和文本的模型,包括RunAnywhere自身文档记录的OCR支持
  • 嵌入(Embeddings) — 在设备端生成向量嵌入,可用于设备端搜索或检索增强生成(RAG),无需将文档发送到服务器
  • 模型路由 — 根据RunAnywhere自身的资料,其提供一个路由层,可根据任务在不同的本地模型或引擎之间选择

硬件加速:MetalRT、QHexRT与WebGPU

RunAnywhere自身的定位是"手写能让消费级芯片跑得更快的GPU和NPU内核",而不是仅依赖通用推理库。根据项目自身的博客和文档,这体现为两个专有的命名推理引擎,加上浏览器端的加速能力。

MetalRT

目标硬件:
Apple Silicon(Metal/MLX)
加速对象:
Mac和iOS设备上的LLM、视觉语言模型及语音到语音管线

QHexRT

目标硬件:
高通骁龙Hexagon NPU(v75/v79/v81)
加速对象:
支持的Android设备上的LLM、VLM、语音转文本、文本转语音及嵌入

WebGPU

目标硬件:
支持WebGPU的浏览器
加速对象:
Web/TypeScript SDK的浏览器内推理,在WebGPU不可用时回退到仅WebAssembly执行

根据RunAnywhere自身的博客,该公司在2026年3月的一篇文章中报告称,MetalRT上的视觉语言模型解码吞吐量在M4 Max上超过了mlx-vlm库;在2026年7月的一篇文章中报告称,已将一款270亿参数的模型(据RunAnywhere自身描述,是一款1比特量化的"PrismML Bonsai"模型)部署到iPhone、Android和Mac上。这些是RunAnywhere在自身博客上就自家产品作出的性能与能力方面的声明;PromptQuorum未对这些基准测试进行独立复现,此处仅作为该公司自行报告的数字呈现,而非经过验证的第三方结果。

支持的平台与语言

根据其自身的GitHub README,RunAnywhere提供八个共享同一原生运行时核心的独立SDK包。

iOS 17.5+ / macOS 14.5+

语言 / 包管理器:
Swift,通过Swift Package Manager

Android API 24+

语言 / 包管理器:
Kotlin,通过Gradle

iOS / Android(跨平台)

语言 / 包管理器:
Flutter,通过pub.dev

iOS / Android(跨平台)

语言 / 包管理器:
React Native

Web浏览器

语言 / 包管理器:
TypeScript/WebAssembly,通过npm

Windows x64桌面(预览版)

语言 / 包管理器:
Electron

Windows / macOS / Linux

语言 / 包管理器:
Python,通过pip

终端(macOS / Linux / Windows)

语言 / 包管理器:
rcli CLI,通过Homebrew或安装脚本

项目方明确将Windows桌面(Electron)SDK标记为预览版——在决定用什么来构建生产级功能时,应将其视为成熟度低于Swift、Kotlin或Flutter SDK。在正式采用某个平台SDK之前,请始终查阅docs.runanywhere.ai以了解其当前的成熟度水平。

近期里程碑

RunAnywhere在自身博客上发布带有具体日期的工程更新。以下条目均摘自该博客;PromptQuorum未独立验证其背后的性能数据,请将这些数字视为该公司自行报告的内容。

  1. 1
    Android离线语音代理(据RunAnywhere博客,2026年2月)
    Why it matters: RunAnywhere描述其在Android上交付了一个完全离线、不依赖云端的功能齐全的AI代理。
  2. 2
    FastVoice延迟里程碑(据RunAnywhere博客,2026年2月)
    Why it matters: RunAnywhere报告称,其设备端语音管线的首次音频延迟为63毫秒。
  3. 3
    面向Apple Silicon的语音引擎(据RunAnywhere博客,2026年3月)
    Why it matters: RunAnywhere称这是其首个在Apple Silicon上同时处理LLM、STT和TTS的推理引擎。
  4. 4
    MetalRT支持视觉语言模型(据RunAnywhere博客,2026年3月)
    Why it matters: RunAnywhere报告称,其在Apple Silicon上的视觉模型解码吞吐量据称超过了M4 Max上的mlx-vlm库。
  5. 5
    MetalRT支持语音到语音(据RunAnywhere博客,2026年3月)
    Why it matters: RunAnywhere报告称,其原生语音到语音管线的端到端延迟为1.68秒。
  6. 6
    面向高通Hexagon NPU的QHexRT发布(据RunAnywhere博客,2026年6月)
    Why it matters: RunAnywhere称这是一款覆盖LLM、VLM、STT、TTS和嵌入的全栈NPU推理引擎,适用于支持的骁龙设备。
  7. 7
    在手机硬件上运行270亿参数模型(据RunAnywhere博客,2026年7月)
    Why it matters: RunAnywhere报告称,已在iPhone、Android和Mac上部署了一款1比特量化的270亿参数模型,并称这是该公司在NPU上运行的首个1比特模型。

谁适合使用RunAnywhere?

RunAnywhere适合一种特定的决策场景:正在构建自有移动端或Web应用、希望获得设备端AI功能而不是依赖云端API的开发团队。

竞品与替代方案

RunAnywhere所处的领域是设备端推理SDK/运行时,与其他允许开发者在本地而非通过云端API运行模型的工具并列。完整目录请参见本地LLM软件目录

  • MLC LLM — 一个开源的机器学习编译框架,用于将LLM部署到手机、浏览器及其他边缘设备;对于希望自行编译和控制推理图、而非使用托管式SDK的团队而言,是更接近的比较对象。
  • MLC Chat — 基于MLC LLM构建的参考移动聊天应用;虽然它是一款可下载的应用,而非开发者SDK,但作为从终端用户角度理解设备端SDK的一个可运行示例,仍具参考价值。
  • llama.cpp — 一个被广泛使用的C/C++推理引擎,许多本地AI工具(包括RunAnywhere自身的Android/Kotlin和Flutter/Web引擎模块)都基于它实现CPU及跨平台推理。
  • Docker Model Runner — 本地推理的另一种集成方式(作为Docker Desktop/Engine的CLI功能,而非移动应用SDK),对于在本地推理的后端/服务端方案与直接嵌入客户端应用的设备端SDK之间进行权衡的团队而言,是一个有用的对照。

评估RunAnywhere时的常见误区

关于RunAnywhere的大部分误解,源于其许可条款、它是SDK而非应用的本质,或是对该公司自行报告的基准测试主张的过度概括。

常见问题

RunAnywhere是什么?

RunAnywhere(runanywhere.ai,源代码位于github.com/RunanywhereAI/runanywhere-sdks)是一款设备端AI SDK,开发者将其集成到iOS、Android、Flutter、React Native和Web应用中,以在用户设备上本地运行LLM聊天、语音转文本、文本转语音、语音活动检测和视觉语言模型。

RunAnywhere是免费的吗?

根据项目自身的"RunAnywhere License",对个人、教育机构、非营利组织、政府机构、经OSI批准的开源项目,以及融资额低于100万美元且年收入低于100万美元的组织免费。超过上述任一门槛的组织需要向RunAnywhere, Inc.购买付费商业许可。

RunAnywhere是开源的吗?

有条件地部分开源。其自身仓库将该许可描述为"基于Apache 2.0,附加商业使用条款",而非未经修改的Apache License 2.0。符合条件的用户可获得类似Apache 2.0的权限,但免费层级依赖于持续保持在特定的融资和收入门槛以下——在依据此作出法律决策之前,请直接阅读LICENSE文件

RunAnywhere是可下载的应用吗?

不是。RunAnywhere是开发者集成到自身应用中的软件开发工具包(SDK),并不是终端用户可以直接下载并打开使用的东西。你只会在开发团队用它构建的应用内部遇到它。

RunAnywhere支持哪些平台?

面向iOS 17.5+和macOS 14.5+的Swift、面向Android API 24+的Kotlin、Flutter、React Native、面向Web浏览器的TypeScript/WebAssembly SDK、Python包、基于Electron的Windows桌面预览版,以及名为rcli的终端CLI工具。

如何安装RunAnywhere的Flutter SDK?

在你的pubspec.yaml中添加runanywhere: ^0.20.11(以及runanywhere_llamacpp等引擎包)。当前版本请查阅pub.dev/packages/runanywhere

RunAnywhere支持哪些AI能力?

根据项目自身文档,包括LLM聊天与文本生成、语音转文本、文本转语音、语音活动检测、视觉语言模型(包括OCR)、嵌入、检索增强生成以及模型路由。

RunAnywhere是否使用NPU或GPU加速?

是的。RunAnywhere报告称拥有两款专有推理引擎:面向Apple Silicon(Metal/MLX)的MetalRT,以及面向高通骁龙Hexagon NPU(v75/v79/v81)的QHexRT,此外在支持的浏览器中还提供WebGPU加速。

RunAnywhere有多少GitHub星标?

截至本评测撰写时,github.com/RunanywhereAI/runanywhere-sdks上约有10,300个星标和376个分支(fork)——最新数字请直接查阅该仓库。

RunAnywhere与MLC LLM有什么区别?

MLC LLM是一个开源的机器学习编译框架,需要你自己编译模型;RunAnywhere则是一款托管式SDK,配备预构建的原生引擎(MetalRT、QHexRT)以及跨多种客户端语言的一致API模式。更详细的对比请参见上方的竞品与替代方案

资料来源

← 返回 本地LLM进阶