Skip to main content
PromptQuorum
主页/本地LLM进阶/OlliteRT 评测:把 Android 手机变成本地 LLM 服务器
Mobile & Edge LLMs

OlliteRT 评测:把 Android 手机变成本地 LLM 服务器

·阅读约10分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

OlliteRT 是一款免费开源的 Android 应用,把手机变成一个完全本地、兼容 OpenAI 的 LLM 推理服务器,其创建者本人将其描述为"Android 版 Ollama"。 它通过 Google 的 LiteRT-LM 运行时,使用 .litertlm 模型文件完全在设备端运行模型,在本地网络上暴露兼容 chat-completions 和 Anthropic Messages 的 HTTP 端点,自身不附带任何聊天界面——它是供其他应用或设备连接的后端。

OlliteRT(github.com/NightMean/OlliteRT)是由开发者 NightMean 创建的免费开源 Android 应用,可以把手机变成一个完全本地、兼容 OpenAI 的 LLM 推理服务器。它完全运行在 Google 的 LiteRT-LM 设备端运行时上,需要 .litertlm 模型文件,自身没有聊天界面——同一网络上的其他设备通过 HTTP 与它通信。本评测将准确说明它做什么、硬件要求,以及适合谁使用。

关键要点

  • OlliteRT(github.com/NightMean/OlliteRT)是一款免费开源的 Android 应用,在本地运行 LLM 并通过 HTTP 提供服务——不是聊天应用
  • 由开发者 NightMean 创建;仓库创建于 2026 年 4 月 6 日
  • Apache-2.0 许可,已通过 GitHub 仓库的许可元数据确认
  • 完全通过 Google 的 LiteRT-LM 运行时在设备端运行,仅使用 .litertlm 模型文件——不支持 GGUF
  • 暴露兼容 OpenAI 的 HTTP API(chat completions、completions),外加兼容 Anthropic Messages API 的端点,供本地网络上的其他设备调用
  • 截至本评测,GitHub 星标超过 350,分支数 47;最新的标签版本是 v0.9.6-beta.1(2026 年 6 月 6 日),项目尚未发布 1.0 版本

📍 简单一句话

OlliteRT 是由开发者 NightMean 创建的免费开源(Apache-2.0)Android 应用,使用 Google 的 LiteRT-LM 运行时,把手机变成一个完全本地、兼容 OpenAI 的 LLM 推理服务器,截至本评测 GitHub 星标已超过 350。

💬 简单来说

与在手机上运行聊天应用不同,OlliteRT 把手机本身变成一个小型服务器:你把模型加载到手机上,启动服务器,家庭网络上的其他设备——笔记本电脑、脚本、智能家居工具——就能向它发送文本并收到回复,方式与调用 OpenAI 的 API 相同,只不过一切都运行在手机上。

📌: 本评测基于 OlliteRT 自己的 GitHub 仓库、README 和发布历史。并不代表 PromptQuorum 在特定手机型号上进行过实测吞吐量或电池消耗基准测试。

OlliteRT 是什么?

OlliteRT 是一款 Android 应用程序,能把运行它的手机变成本地 LLM 推理服务器,其 GitHub 仓库自身的描述是让你能"把 Android 手机变成一个兼容 OpenAI 的 LLM 推理服务器——完全本地、私密且开源"。 它自身没有内置聊天窗口;它的用途是执行推理并响应来自其他软件的 HTTP 请求。

  • 产品类型:Android 后端服务器应用程序,不是聊天客户端——不包含任何聊天界面
  • 创建者:开发者 NightMean;GitHub 仓库托管在 github.com/NightMean/OlliteRT
  • 根据 GitHub 的仓库元数据,仓库创建于 2026 年 4 月 6 日——截至本评测仍是一个年轻的项目
  • 许可:Apache-2.0,已通过 GitHub 仓库的许可元数据确认
  • 推理引擎:Google 的 LiteRT-LM 设备端运行时,与 Google 自家 Android 工具中设备端 AI 功能所用的底层技术相同
  • 规模:截至本评测,GitHub 星标超过 350,分支数 47

项目历史与版本里程碑

OlliteRT 的 GitHub 仓库创建于 2026 年 4 月 6 日,此后已发布三个带标签的 1.0 之前版本,均仍标记为 Beta。

  1. 1
    2026 年 4 月 6 日:仓库创建
    Why it matters: 根据 GitHub 的仓库元数据,标志着项目的起点。
  2. 2
    v0.9.0-beta.1 — 2026 年 4 月 24 日
    Why it matters: 在项目 GitHub 发布页面上找到的第一个带标签版本。
  3. 3
    v0.9.5-beta.1 — 2026 年 4 月 30 日
    Why it matters: 在第一个标签发布约一周后的后续 Beta 版本。
  4. 4
    v0.9.6-beta.1 — 2026 年 6 月 6 日
    Why it matters: 截至本评测的最新标签版本;项目尚未发布 1.0 版本。

OlliteRT 到底做什么?

OlliteRT 在手机上加载一个 .litertlm 模型文件,通过 Google 的 LiteRT-LM 运行时使用手机自身的 CPU 和 GPU 执行推理,并通过一个兼容 OpenAI 的 HTTP API 提供结果,供同一网络上的其他设备调用。

  • 设备端推理:仅使用 Google 的 LiteRT-LM 运行时——没有云端回退,也没有其他后端引擎
  • 模型格式:仅支持 .litertlm 文件;不支持基于 llama.cpp 的工具所使用的 GGUF 格式
  • 模型获取:根据项目 README,支持的模型可从 HuggingFace 一键下载
  • API 兼容性:通过本地网络的 HTTP,暴露兼容 OpenAI 的 chat-completions 和 completions 端点,外加兼容 Anthropic Messages API 的端点
  • 多模态支持:根据 README,只要底层模型本身支持相应模式,就支持视觉、音频和"思考"(推理)模型
  • 硬件加速:可按模型配置 GPU 或 CPU 加速设置
  • 运维工具:内置基准测试工具、带 JSON 高亮的活动日志、服务器监控仪表板、Prometheus 指标集成,以及 Home Assistant REST API 集成
  • 单模型、顺序处理设计:README 中记录仅同时加载一个模型,请求按顺序处理,而非并行处理

使用示例:两种使用 OlliteRT 的方式

以下是基于上述项目已文档化功能构建的具体工作流程。

平台、价格与许可

平台

OlliteRT 的说明:
仅限 Android(arm64-v8a 设备,Android 12 以上)。没有 iOS、桌面或网页版本。

费用

OlliteRT 的说明:
免费且开源。README 中未发现账户、订阅或应用内购买要求。

许可

OlliteRT 的说明:
Apache-2.0,已通过 GitHub 仓库的许可元数据确认。

硬件最低要求

OlliteRT 的说明:
根据 README,最低 6 GB RAM;建议 8 GB 以上,更大型或多模态的模型(如需要 12 GB RAM 的 Gemma 4 E4B)需要更多。

安装方式

OlliteRT 的说明:
直接从 GitHub 发布页下载 APK;截至本评测,未发现 Google Play 或 F-Droid 上架。

由于项目仍处于 1.0 之前的阶段且仍在发展,选定手机或模型之前,请直接在 GitHub 上核实当前的硬件建议和支持的模型列表,因为两者都可能变化。

OlliteRT vs. PocketPal AI

OlliteRT 和 PocketPal AI 都在手机上本地运行 LLM,但用途不同:OlliteRT 是供其他设备通信的无头服务器,而 PocketPal AI 是直接在手机上使用的聊天应用。

方面
OlliteRT
PocketPal AI
主要用途供网络上其他设备使用的无头推理服务器直接在手机上使用的设备端聊天应用
聊天界面不包含内置聊天 UI
推理引擎Google LiteRT-LM基于 llama.cpp(GGUF 模型)
模型格式仅 .litertlmGGUF
平台仅限 AndroidAndroid 和 iOS
API 服务器兼容 OpenAI 的 HTTP API,核心功能并非核心功能

如果你想从笔记本电脑、脚本或智能家居中枢向作为服务器的手机发送请求,OlliteRT 正是为此而生。如果你想直接在手机自己的屏幕上与本地模型聊天,像 PocketPal AI 这样以聊天为先的应用更合适——详见 PocketPal AI 评测

谁应该使用 OlliteRT?

OlliteRT 适合那些想把一台 Android 手机改造成专用的、完全本地的 LLM 服务器供其他设备使用,而不是直接在手机上与模型聊天的开发者和爱好者。

OlliteRT 不适合哪些场景

如果你需要聊天界面、GGUF 模型支持、并行请求处理,或一段长期确立的稳定发布历史,OlliteRT 都不适合。

  • 不是聊天应用——没有内置聊天窗口;它只响应来自其他软件的 HTTP API 请求
  • 不兼容 GGUF——它只支持 .litertlm 模型文件,因此如果没有单独的转换步骤,无法加载 llama.cpp、Ollama 或大多数其他本地 LLM 工具所使用的 GGUF 模型
  • 不是为并发负载而构建——README 中记录的是加载单个模型并按顺序处理,因此并未设计为多用户或高吞吐量服务器
  • 不兼容 iOS——仅限 Android,且专门要求 arm64-v8a 设备
  • 不是成熟的 1.0 发布版本——截至本评测,仓库大约只有五个月历史,最新的标签版本(v0.9.6-beta.1)仍带有 Beta 标签

评估 OlliteRT 时的常见误区

关于 OlliteRT 的大部分困惑,源于误以为它是聊天应用、把它的模型格式与 GGUF 混淆,或者忽略了它还是一个年轻项目这一事实。

竞品与替代方案

OlliteRT 最常与其他 Android/移动端本地 LLM 应用进行比较——它的主要差异点在于它是一个无头的、兼容 OpenAI 的服务器,而不是手机上的聊天客户端。

工具
主要特点
链接
PocketPal AI面向 Android 和 iOS 的设备端聊天应用,通过 llama.cpp 使用 GGUF 模型PocketPal AI 评测
Layla专注于本地、无审查角色扮演和助手用途的 Android 聊天应用Layla 评测
Google AI Edge GalleryGoogle 自家展示应用,通过 LiteRT/MediaPipe 使用设备端模型Google AI Edge Gallery 评测
MLC Chat构建在 MLC LLM 编译器技术栈之上的跨平台(Android/iOS)本地聊天应用MLC Chat 评测

此列表反映了移动端/设备端 LLM 领域中常与 OlliteRT 比较的工具,并非 PromptQuorum 的独立排名——选择前请核实每个工具当前的功能集和支持的模型格式。

常见问题

OlliteRT 是什么?

OlliteRT(github.com/NightMean/OlliteRT)是由开发者 NightMean 创建的免费开源(Apache-2.0)Android 应用,使用 Google 的 LiteRT-LM 运行时,把手机变成一个完全本地、兼容 OpenAI 的 LLM 推理服务器。

OlliteRT 有聊天界面吗?

没有。OlliteRT 没有内置聊天窗口。它是一个无头服务器——你通过其 HTTP API 从另一台设备或应用与它交互,而不是直接在应用内输入文字。

OlliteRT 免费吗?

是的,OlliteRT 在 Apache-2.0 许可下免费且开源。本评测未发现账户、订阅或应用内购买要求。

OlliteRT 使用什么模型格式?

OlliteRT 仅使用面向 Google LiteRT-LM 设备端运行时的 .litertlm 模型文件。它不支持基于 llama.cpp 的工具所使用的 GGUF 格式。

OlliteRT 的硬件要求是什么?

Android 12 或更高版本、arm64-v8a 设备,最低 6 GB RAM(建议 8 GB 以上)。根据项目 README,更大型或多模态的模型(如 Gemma 4 E4B)需要 12 GB 或更多 RAM。

OlliteRT 在没有互联网连接的情况下能工作吗?

模型下载完成后,推理本身完全在设备端运行,因此不需要互联网连接。其他设备需要本地网络连接才能访问手机上的 API 服务器,而首次从 HuggingFace 下载模型则需要互联网访问。

OlliteRT 能同时处理多个请求吗?

不能。项目 README 中记录仅同时加载一个模型,请求按顺序处理,而非并行处理——它不是为并发、多用户负载而设计的。

OlliteRT 支持 iOS 吗?

不支持,OlliteRT 仅限 Android,且专门需要运行 Android 12 或更高版本的 arm64-v8a 设备。

如何安装 OlliteRT?

直接从 GitHub 发布页面下载 APK。截至本评测,它未在 Google Play 或 F-Droid 上架。

OlliteRT 是一个成熟稳定的项目吗?

还不是。它的 GitHub 仓库创建于 2026 年 4 月,最新的标签版本(v0.9.6-beta.1,2026 年 6 月)仍带有 Beta 标签——请将其视为一个正在积极开发中的 1.0 之前项目。

来源

← 返回 本地LLM进阶