关键要点
- OlliteRT(github.com/NightMean/OlliteRT)是一款免费开源的 Android 应用,在本地运行 LLM 并通过 HTTP 提供服务——不是聊天应用
- 由开发者 NightMean 创建;仓库创建于 2026 年 4 月 6 日
- Apache-2.0 许可,已通过 GitHub 仓库的许可元数据确认
- 完全通过 Google 的 LiteRT-LM 运行时在设备端运行,仅使用
.litertlm模型文件——不支持 GGUF - 暴露兼容 OpenAI 的 HTTP API(chat completions、completions),外加兼容 Anthropic Messages API 的端点,供本地网络上的其他设备调用
- 截至本评测,GitHub 星标超过 350,分支数 47;最新的标签版本是 v0.9.6-beta.1(2026 年 6 月 6 日),项目尚未发布 1.0 版本
📍 简单一句话
OlliteRT 是由开发者 NightMean 创建的免费开源(Apache-2.0)Android 应用,使用 Google 的 LiteRT-LM 运行时,把手机变成一个完全本地、兼容 OpenAI 的 LLM 推理服务器,截至本评测 GitHub 星标已超过 350。
💬 简单来说
与在手机上运行聊天应用不同,OlliteRT 把手机本身变成一个小型服务器:你把模型加载到手机上,启动服务器,家庭网络上的其他设备——笔记本电脑、脚本、智能家居工具——就能向它发送文本并收到回复,方式与调用 OpenAI 的 API 相同,只不过一切都运行在手机上。
📌注: 本评测基于 OlliteRT 自己的 GitHub 仓库、README 和发布历史。并不代表 PromptQuorum 在特定手机型号上进行过实测吞吐量或电池消耗基准测试。
OlliteRT 是什么?
OlliteRT 是一款 Android 应用程序,能把运行它的手机变成本地 LLM 推理服务器,其 GitHub 仓库自身的描述是让你能"把 Android 手机变成一个兼容 OpenAI 的 LLM 推理服务器——完全本地、私密且开源"。 它自身没有内置聊天窗口;它的用途是执行推理并响应来自其他软件的 HTTP 请求。
- 产品类型:Android 后端服务器应用程序,不是聊天客户端——不包含任何聊天界面
- 创建者:开发者 NightMean;GitHub 仓库托管在 github.com/NightMean/OlliteRT
- 根据 GitHub 的仓库元数据,仓库创建于 2026 年 4 月 6 日——截至本评测仍是一个年轻的项目
- 许可:Apache-2.0,已通过 GitHub 仓库的许可元数据确认
- 推理引擎:Google 的 LiteRT-LM 设备端运行时,与 Google 自家 Android 工具中设备端 AI 功能所用的底层技术相同
- 规模:截至本评测,GitHub 星标超过 350,分支数 47
项目历史与版本里程碑
OlliteRT 的 GitHub 仓库创建于 2026 年 4 月 6 日,此后已发布三个带标签的 1.0 之前版本,均仍标记为 Beta。
- 12026 年 4 月 6 日:仓库创建
Why it matters: 根据 GitHub 的仓库元数据,标志着项目的起点。 - 2v0.9.0-beta.1 — 2026 年 4 月 24 日
Why it matters: 在项目 GitHub 发布页面上找到的第一个带标签版本。 - 3v0.9.5-beta.1 — 2026 年 4 月 30 日
Why it matters: 在第一个标签发布约一周后的后续 Beta 版本。 - 4v0.9.6-beta.1 — 2026 年 6 月 6 日
Why it matters: 截至本评测的最新标签版本;项目尚未发布 1.0 版本。
OlliteRT 到底做什么?
OlliteRT 在手机上加载一个 .litertlm 模型文件,通过 Google 的 LiteRT-LM 运行时使用手机自身的 CPU 和 GPU 执行推理,并通过一个兼容 OpenAI 的 HTTP API 提供结果,供同一网络上的其他设备调用。
- 设备端推理:仅使用 Google 的 LiteRT-LM 运行时——没有云端回退,也没有其他后端引擎
- 模型格式:仅支持
.litertlm文件;不支持基于 llama.cpp 的工具所使用的 GGUF 格式 - 模型获取:根据项目 README,支持的模型可从 HuggingFace 一键下载
- API 兼容性:通过本地网络的 HTTP,暴露兼容 OpenAI 的 chat-completions 和 completions 端点,外加兼容 Anthropic Messages API 的端点
- 多模态支持:根据 README,只要底层模型本身支持相应模式,就支持视觉、音频和"思考"(推理)模型
- 硬件加速:可按模型配置 GPU 或 CPU 加速设置
- 运维工具:内置基准测试工具、带 JSON 高亮的活动日志、服务器监控仪表板、Prometheus 指标集成,以及 Home Assistant REST API 集成
- 单模型、顺序处理设计:README 中记录仅同时加载一个模型,请求按顺序处理,而非并行处理
使用示例:两种使用 OlliteRT 的方式
以下是基于上述项目已文档化功能构建的具体工作流程。
安装 OlliteRT
OlliteRT 可从 GitHub 发布页免费安装为 APK,其源代码托管在 GitHub 上。
来源 | 链接 |
|---|---|
| GitHub 发布页(APK 下载) | github.com/NightMean/OlliteRT/releases |
| GitHub 仓库(源代码,Apache-2.0) | github.com/NightMean/OlliteRT |
截至本评测,OlliteRT 仅通过 GitHub 发布页直接下载 APK 进行分发——本评测未在 Google Play 或 F-Droid 上找到其上架信息。需要 Android 12 或更高版本、arm64-v8a 设备。从 Google Play 之外安装 APK 需要在 Android 设置中启用"允许安装未知来源应用";请务必只从官方 GitHub 发布页下载该 APK。
平台、价格与许可
平台
- OlliteRT 的说明:
- 仅限 Android(arm64-v8a 设备,Android 12 以上)。没有 iOS、桌面或网页版本。
费用
- OlliteRT 的说明:
- 免费且开源。README 中未发现账户、订阅或应用内购买要求。
许可
- OlliteRT 的说明:
- Apache-2.0,已通过 GitHub 仓库的许可元数据确认。
硬件最低要求
- OlliteRT 的说明:
- 根据 README,最低 6 GB RAM;建议 8 GB 以上,更大型或多模态的模型(如需要 12 GB RAM 的 Gemma 4 E4B)需要更多。
安装方式
- OlliteRT 的说明:
- 直接从 GitHub 发布页下载 APK;截至本评测,未发现 Google Play 或 F-Droid 上架。
由于项目仍处于 1.0 之前的阶段且仍在发展,选定手机或模型之前,请直接在 GitHub 上核实当前的硬件建议和支持的模型列表,因为两者都可能变化。
OlliteRT vs. PocketPal AI
OlliteRT 和 PocketPal AI 都在手机上本地运行 LLM,但用途不同:OlliteRT 是供其他设备通信的无头服务器,而 PocketPal AI 是直接在手机上使用的聊天应用。
方面 | OlliteRT | PocketPal AI |
|---|---|---|
| 主要用途 | 供网络上其他设备使用的无头推理服务器 | 直接在手机上使用的设备端聊天应用 |
| 聊天界面 | 不包含 | 内置聊天 UI |
| 推理引擎 | Google LiteRT-LM | 基于 llama.cpp(GGUF 模型) |
| 模型格式 | 仅 .litertlm | GGUF |
| 平台 | 仅限 Android | Android 和 iOS |
| API 服务器 | 兼容 OpenAI 的 HTTP API,核心功能 | 并非核心功能 |
如果你想从笔记本电脑、脚本或智能家居中枢向作为服务器的手机发送请求,OlliteRT 正是为此而生。如果你想直接在手机自己的屏幕上与本地模型聊天,像 PocketPal AI 这样以聊天为先的应用更合适——详见 PocketPal AI 评测。
谁应该使用 OlliteRT?
OlliteRT 适合那些想把一台 Android 手机改造成专用的、完全本地的 LLM 服务器供其他设备使用,而不是直接在手机上与模型聊天的开发者和爱好者。
OlliteRT 不适合哪些场景
如果你需要聊天界面、GGUF 模型支持、并行请求处理,或一段长期确立的稳定发布历史,OlliteRT 都不适合。
- 不是聊天应用——没有内置聊天窗口;它只响应来自其他软件的 HTTP API 请求
- 不兼容 GGUF——它只支持
.litertlm模型文件,因此如果没有单独的转换步骤,无法加载 llama.cpp、Ollama 或大多数其他本地 LLM 工具所使用的 GGUF 模型 - 不是为并发负载而构建——README 中记录的是加载单个模型并按顺序处理,因此并未设计为多用户或高吞吐量服务器
- 不兼容 iOS——仅限 Android,且专门要求 arm64-v8a 设备
- 不是成熟的 1.0 发布版本——截至本评测,仓库大约只有五个月历史,最新的标签版本(v0.9.6-beta.1)仍带有 Beta 标签
评估 OlliteRT 时的常见误区
关于 OlliteRT 的大部分困惑,源于误以为它是聊天应用、把它的模型格式与 GGUF 混淆,或者忽略了它还是一个年轻项目这一事实。
竞品与替代方案
OlliteRT 最常与其他 Android/移动端本地 LLM 应用进行比较——它的主要差异点在于它是一个无头的、兼容 OpenAI 的服务器,而不是手机上的聊天客户端。
工具 | 主要特点 | 链接 |
|---|---|---|
| PocketPal AI | 面向 Android 和 iOS 的设备端聊天应用,通过 llama.cpp 使用 GGUF 模型 | PocketPal AI 评测 |
| Layla | 专注于本地、无审查角色扮演和助手用途的 Android 聊天应用 | Layla 评测 |
| Google AI Edge Gallery | Google 自家展示应用,通过 LiteRT/MediaPipe 使用设备端模型 | Google AI Edge Gallery 评测 |
| MLC Chat | 构建在 MLC LLM 编译器技术栈之上的跨平台(Android/iOS)本地聊天应用 | MLC Chat 评测 |
此列表反映了移动端/设备端 LLM 领域中常与 OlliteRT 比较的工具,并非 PromptQuorum 的独立排名——选择前请核实每个工具当前的功能集和支持的模型格式。
常见问题
OlliteRT 是什么?
OlliteRT(github.com/NightMean/OlliteRT)是由开发者 NightMean 创建的免费开源(Apache-2.0)Android 应用,使用 Google 的 LiteRT-LM 运行时,把手机变成一个完全本地、兼容 OpenAI 的 LLM 推理服务器。
OlliteRT 有聊天界面吗?
没有。OlliteRT 没有内置聊天窗口。它是一个无头服务器——你通过其 HTTP API 从另一台设备或应用与它交互,而不是直接在应用内输入文字。
OlliteRT 免费吗?
是的,OlliteRT 在 Apache-2.0 许可下免费且开源。本评测未发现账户、订阅或应用内购买要求。
OlliteRT 使用什么模型格式?
OlliteRT 仅使用面向 Google LiteRT-LM 设备端运行时的 .litertlm 模型文件。它不支持基于 llama.cpp 的工具所使用的 GGUF 格式。
OlliteRT 的硬件要求是什么?
Android 12 或更高版本、arm64-v8a 设备,最低 6 GB RAM(建议 8 GB 以上)。根据项目 README,更大型或多模态的模型(如 Gemma 4 E4B)需要 12 GB 或更多 RAM。
OlliteRT 在没有互联网连接的情况下能工作吗?
模型下载完成后,推理本身完全在设备端运行,因此不需要互联网连接。其他设备需要本地网络连接才能访问手机上的 API 服务器,而首次从 HuggingFace 下载模型则需要互联网访问。
OlliteRT 能同时处理多个请求吗?
不能。项目 README 中记录仅同时加载一个模型,请求按顺序处理,而非并行处理——它不是为并发、多用户负载而设计的。
OlliteRT 支持 iOS 吗?
不支持,OlliteRT 仅限 Android,且专门需要运行 Android 12 或更高版本的 arm64-v8a 设备。
如何安装 OlliteRT?
直接从 GitHub 发布页面下载 APK。截至本评测,它未在 Google Play 或 F-Droid 上架。
OlliteRT 是一个成熟稳定的项目吗?
还不是。它的 GitHub 仓库创建于 2026 年 4 月,最新的标签版本(v0.9.6-beta.1,2026 年 6 月)仍带有 Beta 标签——请将其视为一个正在积极开发中的 1.0 之前项目。