关键要点
- PocketPal AI是最佳免费默认选择。 开源、App Store安装,支持Hugging Face上任意GGUF模型。在iPhone 16 Pro上以约10–15 tokens/秒运行Phi-4 Mini。适合大多数用户的推荐起点。
- Private LLM是最佳付费选项($4.99买断,无需订阅)。 一次购买即可覆盖iPhone、iPad和Mac,并支持家庭共享。精选模型库、iOS Shortcuts集成,支持"嘿Siri,问一下Private LLM"语音命令。
- Locally AI是免费的MLX替代方案,现由LM Studio团队开发。 基于Apple MLX运行Llama、Gemma、Qwen和DeepSeek模型,支持iOS Shortcuts,还能将苹果自家的设备端基础模型变为可对话的界面。
- MLC Chat采用Metal加速,但已停更。 其MLC LLM引擎在相同硬件上仍比基于llama.cpp的应用快约25–35%,但应用本身自2024年底以来未再更新,模型库停留在Phi-4 Mini和Gemma 3之前。
- LLM Farm已于2025年8月从App Store下架。 项目自己的README将其描述为"暂时不可用"。它仍保持开源,可通过Xcode从源码编译,对开发者而言依然是可配置性最强的选择(mirostat、对话模板)。
- Apple Intelligence在设备端运行,但非独立应用。 苹果约3B基础模型为邮件、信息、备忘录等系统功能提供支持。自iOS 26起,第三方应用可通过Foundation Models框架调用该模型,Shortcuts也可通过"使用模型"动作调用它。
- iPhone 16 Pro / 17 Pro推荐模型:Phi-4 Mini(3.8B Q4_K_M,约2.7 GB)。 8 GB以上内存档次的最佳性价比选择。6 GB内存旧款iPhone(iPhone 14 Pro):推荐Qwen3 1.7B或SmolLM 2 1.7B。
快速概览
- 对比应用: PocketPal AI、Private LLM、Locally AI(LM Studio出品)、MLC Chat、Apple Intelligence(系统)——以及已于2025年8月从App Store下架的LLM Farm。
- 测试设备: iPhone 16 Pro(A18 Pro,8 GB内存)和iPhone 17 Pro(A19 Pro,12 GB内存)。
- 推理引擎: llama.cpp(PocketPal AI、LLM Farm),Apple MLX(Locally AI),Metal加速的MLC LLM(MLC Chat),私有设备端运行时(Private LLM、Apple Intelligence)。
- 运行3B以上模型的最低iPhone要求: iPhone 14 Pro(A16,6 GB内存)可运行1.7B;任意8 GB以上iPhone(15 Pro、16系列、16e、17系列)可运行3B–4B。
- 最佳免费应用: PocketPal AI——App Store、开源、模型灵活性高。
- 最佳付费应用: Private LLM——$4.99买断(覆盖iPhone+iPad+Mac),支持Shortcuts + Siri。
- 离线使用: 所有五款应用在模型下载后均可完全离线运行,无需调用云端。
首先应该安装哪款iPhone应用?
对大多数用户:在App Store安装PocketPal AI,然后下载Phi-4 Mini(3.8B Q4_K_M)。 这个组合支持iPhone 14 Pro及更新机型,完全免费,能够胜任日常对话、摘要和快速起草等任务。只有在有特定需求时,再考虑其他应用。
📍 简单一句话
2026年大多数iPhone用户:安装PocketPal AI(免费,App Store)并下载Phi-4 Mini——可在6 GB以上内存的任何iPhone上处理日常对话、摘要和写作任务。
💬 简单来说
2026年有五款应用可完全在iPhone上本地运行AI。PocketPal AI是最佳免费起点——安装后一次性下载2.7 GB的模型文件,即可获得一个无需WiFi、在地铁上也能使用的私密AI助手。Private LLM是希望Siri与本地模型对话的付费选择。Locally AI由LM Studio团队出品,是支持Shortcuts的免费现代替代方案。MLC Chat速度快但已不再更新。Apple Intelligence内置于iOS但非对话应用。PocketPal AI可满足90%的使用场景。
决策:选择哪款iPhone本地AI应用?
以下情况使用本地LLM:
- •想要免费的离线AI对话助手 → PocketPal AI
- •想让Siri与本地模型对话 → Private LLM
- •想要支持Shortcuts且可访问Apple Foundation Models的免费MLX应用 → Locally AI
- •愿意接受较旧的模型库以换取Metal最高速度 → MLC Chat
- •只需要在邮件/信息/备忘录中获得写作辅助 → Apple Intelligence(系统内置)
以下情况使用云端模型:
- •需要70B以上模型质量(Llama 3.3 70B、GPT-5.5水平)→ 使用云端或远程连接家用机器
- •需要访问GPT-5.5、Claude Opus或Gemini → 云端应用(本地无法运行这些模型)
- •需要实时视觉或文字以外的多模态输出 → 云端(2026年设备端多模态能力有限)
快速决策:
- →免费 + 满足90%场景:PocketPal AI
- →付费 + iOS原生集成:Private LLM
- →免费 + LM Studio生态:Locally AI

💡提示: 即使计划购买Private LLM,也建议先安装PocketPal AI。用PocketPal AI测试您的iPhone档次的设备端推理速度是否满足需求。如果满意,再判断Private LLM的iOS Shortcuts和Siri集成是否值$4.99。如果不满意,您就在付费前省下了这笔钱。
iPhone应用对比表
五款应用在三个关键维度上有所差异:费用、模型灵活性和iOS集成度。 速度差异存在,但均远小于这些应用与云端LLM之间的差距。
📍 简单一句话
PocketPal AI是最佳免费默认选择,Private LLM是最佳付费选项,Locally AI是LM Studio团队出品的免费MLX之选,MLC Chat速度快但已停更,Apple Intelligence为系统集成型。
💬 简单来说
选择通常取决于三点:是否愿意为Siri集成付费(Private LLM)、是否想免费获得支持Shortcuts的LM Studio生态(Locally AI)、还是愿意接受较旧模型库以换取极致速度(MLC Chat)。其他情况下,PocketPal AI是默认之选。表格数据均以Q4_K_M量化为准——这是2026年移动端推理的标准配置。
应用 | 价格 | Tokens/sec (Phi-4 Mini, 16 Pro) | 隐私保护 | 最适用于 |
|---|---|---|---|---|
| PocketPal AI | 免费(开源) | ~10–15 | 纯本地,无遥测 | 大多数用户的免费默认选择 |
| Private LLM | $4.99买断 | ~10–14 | 纯本地,可选匿名统计 | iOS Shortcuts + Siri集成 |
| Locally AI | 免费(LM Studio团队) | N/A——MLX模型库(无Phi-4) | 纯本地,不收集数据 | MLX + Shortcuts,LM Studio联动 |
| MLC Chat | 免费(开源) | N/A——模型库早于Phi-4 | 纯本地,无遥测 | Metal速度,旧款模型 |
| LLM Farm | 免费(仅源码) | ~10–15 | 纯本地,无遥测 | 高级用户(已从App Store下架) |
| Apple Intelligence | 免费(iOS内置) | N/A(系统功能) | 本地 + 可选Private Cloud Compute | 邮件、信息、备忘录辅助 |
关于Apple神经引擎(ANE)、Metal与MLX的说明: PocketPal AI和LLM Farm使用带有Metal Performance Shaders的llama.cpp进行推理,在GPU上运行。MLC Chat使用经过深度Metal优化的MLC LLM,对其支持的模型而言在相同硬件上tokens/秒高出25–35%。Locally AI使用苹果自家的开源数组框架Apple MLX,在Apple Silicon上实现相近的GPU效率。Apple Intelligence专门为系统约3B模型使用ANE,能效更高但灵活性低于基于Metal的推理。自iOS 26起,第三方应用可通过Foundation Models框架调用该系统模型——Locally AI正是这样做的——但自定义GGUF/MLX模型仍无法直接调用ANE。

💡提示: Tokens/秒数据基于Q4_K_M量化(2026年移动端推理标准)及无其他高负载应用运行的iPhone空闲状态。后台应用会使吞吐量下降10–30%。由于A19 Pro的改进,iPhone 17 Pro的tokens/秒比iPhone 16 Pro高约20–30%。
PocketPal AI:免费开源首选
PocketPal AI是2026年大多数iPhone用户的推荐起点。 免费、开源(GitHub:a-ghorbani/pocketpal-ai),在App Store上架,支持Hugging Face上任意GGUF模型。应用底层使用llama.cpp,并针对Apple Silicon进行了优化。
- 是什么: 一款使用llama.cpp在本地运行GGUF模型的iOS应用。无需订阅、无遥测、无需账号。
- 安装: App Store → 搜索"PocketPal AI"。免费下载。
- 添加模型: 在应用内点击"模型"→"从Hugging Face添加"→搜索(如"phi-4-mini-instruct-Q4_K_M")→点击下载。模型存储在应用本地空间(Phi-4 Mini Q4约2.7 GB)。
- 生成速度(iPhone 16 Pro): Phi-4 Mini约10–15 tok/秒,Llama 3.2 3B约12–18 tok/秒,Gemma 3 4B约7–10 tok/秒,Qwen3 1.7B约18–24 tok/秒。
- 最适用于: 希望使用免费、App Store安装、无需账号、支持任意社区GGUF模型的对话应用的用户。
💡提示: PocketPal AI的模型选择器提供"推荐"筛选项,显示经验证适合您设备内存的模型。对于iPhone 16 Pro(8 GB内存),选择器推荐最高约4B参数的Q4_K_M版本。请信任此筛选器——安装过大的模型会导致iOS在生成回复途中强制关闭应用。
Private LLM:付费版iOS深度集成
Private LLM是2026年iPhone上最强的付费选择($4.99买断,无需订阅)。 仅在App Store上架,内置精选优化模型库。其核心差异化优势在于iOS集成:Shortcuts动作和"嘿Siri,问一下Private LLM"语音命令。
- 是什么: 一款带有精选模型库和深度iOS集成的付费iOS应用。使用针对Apple Silicon优化的私有设备端运行时。
- 安装: App Store → 搜索"Private LLM"。$4.99买断(无订阅)。
- 精选模型库: 约30款预测试并为iPhone优化的模型,包括Llama 3.2 3B、Phi-4 Mini、Mistral Small Instruct及若干非审查版本。灵活性低于PocketPal AI,但不会出现安装后崩溃的问题。
- iOS Shortcuts: Private LLM提供"使用Private LLM生成文本"动作,可集成到Shortcuts自动化流程中。可通过主屏幕按钮或NFC标签触发本地AI。
- Siri集成: "嘿Siri,问一下Private LLM [您的问题]"会将提示词发送至设备端模型并朗读回答,全程无需联网。延迟高于聊天界面(音频开始前约3–5秒)。
💡提示: Private LLM是一次通用购买:$4.99的一次性价格即可覆盖iPhone、iPad和Mac,苹果家庭共享还能扩展到最多六位家庭成员。无订阅、无内购——标价即总花费。
Locally AI:LM Studio出品的免费MLX应用
Locally AI是一款免费、注重隐私的对话应用,现由LM Studio团队开发,基于苹果自家的MLX框架而非llama.cpp构建。 它是这一类别中最新的重量级选手,也是本文中唯一将苹果设备端基础模型以对话界面呈现的应用。
- 是什么: 一款使用Apple MLX进行推理的iOS/iPadOS/macOS应用,由桌面版LM Studio背后的团队开发。
- 安装: App Store → 搜索"Locally AI"。免费,无需账号,100%离线。
- 模型库: Llama 3.2、Gemma 2/3/4、Qwen 3、DeepSeek、LFM 2.5、Bonsai、Ministral 3以及Apple Foundation Models——比MLC Chat更广泛、更新的目录。
- iOS Shortcuts: 提供快捷指令动作,免费实现与Private LLM同级别的自动化支持。
- LM Link: 一项可选功能,通过端到端加密链接连接运行在Mac上的LM Studio,让iPhone应用在需要时切换到家用机器上更大的模型。
- 系统要求: iOS/iPadOS 18.1+(Apple Silicon级别的效率优势在iPhone 15 Pro及更新机型上最为明显)。
💡提示: Locally AI是本文中唯一能将苹果自家设备端基础模型置于普通对话窗口之后的应用——如果您想体验Apple Intelligence的模型能做什么,而不必在写作工具菜单中反复摸索,这很有用。若需第三方GGUF的灵活性,PocketPal AI仍拥有更大的模型库。
MLC Chat:苹果芯片专项优化
MLC Chat(来自MLC LLM项目)仍是Metal加速的参考应用,但应用本身自2024年底以来未再更新。 免费、开源,运行由MLC LLM工具链编译的模型,而非标准GGUF格式——这一编译要求,也正是其模型库未能跟上PocketPal AI和Locally AI步伐的原因。
- 是什么: MLC LLM项目的iOS参考应用,展示MLC LLM在Apple Silicon上的Metal加速推理能力。
- 安装: App Store → 搜索"MLC Chat"。免费。
- 速度优势(架构层面): 对于双方均支持的模型,MLC LLM的Metal加速引擎在同款iPhone上比基于llama.cpp的应用快约25–35%——但应用自身的模型列表早于Phi-4 Mini、Gemma 3等2026年的主流推荐,若不自行编译,这一优势在当下已无法验证。
- 模型库: 仅限MLC LLM项目在应用停止更新前编译的模型——Llama 3.2 3B、RedPajama等2024年时期的模型。并非所有Hugging Face GGUF均可使用,App Store版本中也不包含任何当代小型模型。
- 最适用于: 已投入MLC LLM工具链、愿意自行编译模型的开发者,或特别需要2025年前已内置模型的用户。
⚠️警告: 由于MLC Chat的App Store版本自2024年底以来未再更新,不要指望在其模型选择器中看到Phi-4 Mini、Qwen3或Gemma 3。如果您想在今天使用具备Metal级GPU效率的当代模型,Locally AI(Apple MLX)或PocketPal AI(使用Metal Performance Shaders的llama.cpp)是目前仍在积极维护的替代方案。
LLM Farm:已下架但仍可配置
LLM Farm已于2025年8月从App Store和TestFlight下架——项目自己的GitHub README将其描述为在两个平台上均"暂时不可用"。 该项目(GitHub:guinmoon/LLMFarm)仍保持开源,2026年间也有GitHub issue活跃,但新用户已无法从App Store安装,必须通过Xcode从源码编译。
- 是什么: 开发者@guinmoon的iOS应用,支持大量配置选项运行GGUF模型,此前通过App Store分发。
- 当前可用性: 截至本次更新,无法从App Store或TestFlight安装。源码保持公开且可编译。
- 从源码编译: 克隆代码库,在Xcode中打开,使用免费或付费的Apple开发者账号编译到设备——这是没有App Store上架的开源iOS应用的标准侧载流程。
- 开放的配置项(编译后): 温度、top-p、top-k、mirostat采样、重复惩罚、按模型设置系统提示词、对话模板选择、上下文窗口长度。
- 最适用于: 熟悉在Xcode中从源码编译应用、且特别需要mirostat采样控制的开发者。其他用户应改用PocketPal AI或Locally AI——两者均可完全通过App Store安装,且免费。
⚠️警告: 不要指望能找到有效的LLM Farm App Store链接——在其他地方看到的此类链接应视为已过时。从源码编译需要Xcode及基本的iOS代码签名知识。如果这超出了您愿意投入的精力,PocketPal AI可在不离开App Store的情况下覆盖同样"灵活的免费对话应用"这一使用场景。
Apple Intelligence:系统级内置AI
Apple Intelligence在iPhone 15 Pro及更新机型(A17 Pro芯片,最低8 GB内存)上以设备端方式运行苹果自家约3B基础模型。 默认情况下它不是一款对话应用——而是为邮件(智能回复)、信息(写作工具)、备忘录(摘要)和通知摘要提供系统级功能。自iOS 26起,苹果的Foundation Models框架允许第三方开发者直接调用该设备端模型,Locally AI等应用已将其打造为真正的对话界面。
- 位置: 内置于iOS 18+(Foundation Models框架自iOS 26起加入)。前往设置 → Apple Intelligence与Siri启用。
- 硬件要求: iPhone 15 Pro / 15 Pro Max、iPhone 16系列、iPhone 16e、iPhone 17系列。旧款iPhone(14及以下)不支持Apple Intelligence。
- 设备端功能: 任意文本框内的写作工具(改写、摘要、校对),邮件和信息中的智能回复,通知摘要,Genmoji生成。
- Foundation Models框架(iOS 26+): 一套原生Swift API,让开发者只需几行代码即可直接访问同一设备端模型——Locally AI正是借此将其作为对话选项,Shortcuts的"使用模型"动作也能借此将提示词路由至该模型、Private Cloud Compute或ChatGPT。
- Private Cloud Compute: 超出设备端模型能力的任务会转至Private Cloud Compute(PCC)——苹果运营的服务器运行更大模型,并以密码学手段保证不留存用户数据。PCC为可选项,可关闭。
- 与对话应用的关系: Apple Intelligence是补充而非替代。其系统功能处理iOS应用内的文本改写和摘要;PocketPal AI、Private LLM、Locally AI和MLC Chat提供专用对话界面以回答任意问题——而Locally AI如今也能为苹果自家模型提供同类界面。
💡提示: 如果您只需要Apple Intelligence(改写邮件、汇总通知),则无需单独安装对话应用。如果您想向模型提问,如"用简单语言解释量子隧穿"或"为X项目起草方案",请安装一款对话应用——可以是PocketPal AI这样的专用应用,也可以是能将苹果自家设备端模型置于对话窗口之后的Locally AI。
按iPhone档次推荐模型
iPhone内存决定模型规模上限,与芯片代数无关。 6 GB内存iPhone(14 Pro、15)可稳定运行1.7B模型;8 GB以上内存iPhone(15 Pro、16系列、16e、17系列)可稳定运行3B–4B模型,缓慢运行7B模型。如需了解全硬件档次(不限移动端)的更广泛模型选择,请参阅2026年最佳本地LLM。
iPhone档次(年份,内存) | 推荐型号 | 下载大小 | 预期速度 |
|---|---|---|---|
| iPhone 17 Pro(2025,12 GB) | Phi-4 Mini 或 Llama 3.2 3B(Q4_K_M) | 约2.5–2.7 GB | 约13–20 tok/秒 |
| iPhone 16 Pro / 16 Pro Max / 16e(2024–2025,8 GB) | Phi-4 Mini(3.8B Q4_K_M) | 约2.7 GB | 约10–15 tok/秒 |
| iPhone 15 Pro / Pro Max(2023,8 GB) | Phi-4 Mini(3.8B Q4_K_M) | 约2.7 GB | 约8–12 tok/秒 |
| iPhone 14 Pro / Pro Max(2022,6 GB) | Qwen3 1.7B 或 SmolLM 2 1.7B(Q4_K_M) | 约1.1 GB | 约15–20 tok/秒 |
| iPhone 14 / 15 / 16(非Pro,6 GB) | Qwen3 1.7B 或 SmolLM 2 1.7B(Q4_K_M) | 约1.1 GB | 约12–18 tok/秒 |
| iPhone SE / 旧款(4 GB) | 不建议用于设备端LLM | — | — |
💡提示: 对于旧款6 GB内存iPhone,Qwen3 1.7B是2026年模型规模与质量的最佳平衡点。SmolLM 2 1.7B(HuggingFace)性能相近。两者均可生成连贯的短回复(1–3段),但难以处理多步推理任务。请勿在6 GB内存iPhone上安装Phi-4 Mini——名义上可以装入,但一旦有其他应用占用内存,iOS就会强制关闭对话应用。
电池消耗与过热问题
iPhone上的设备端LLM推理对CPU/GPU消耗较高,会产生热量。 主动推理(模型生成token)消耗约3–5 W;持续生成会触发芯片降频,在iPhone 16 Pro上每小时消耗约20–30%电量。
- 电池消耗(主动对话): iPhone 16 Pro运行Phi-4 Mini时每小时约消耗20–30%。iPhone 17 Pro因峰值功率更高而消耗略快,但因更快完成任务而有所抵消。
- 持续生成约10–15分钟后触发热节流。 芯片表面温度达到约38°C时,iOS降低时钟频率,tokens/秒下降30–50%。让手机冷却后可恢复正常速度。
- 缓解措施: 长时间推理时将iPhone屏幕朝上放在硬质平面上(不要握在手中或放入口袋),以利散热。被动散热保护壳有帮助,但对短时交互通常不必要。
- 后台占用: 生成后将对话应用保留在后台,内存仍被占用但无推理运行——电池影响可忽略不计。完全关闭应用可释放约3 GB内存。
- 推理时MagSafe充电: iPhone 17 Pro和16 Pro(均已改善热设计)可以接受。iPhone 15 Pro同时充电和推理可能更快触达热极限——建议推理后再充电。
⚠️警告: 请勿在阳光直射或高温车内运行设备端LLM推理。环境热量与推理负载叠加会在数分钟内将芯片推至热极限,触发激进降频,甚至出现"iPhone需要冷却"提示。对话应用不会崩溃,但生成速度会极度缓慢。
iOS快捷指令、Siri与侧载
各应用的iOS集成深度差异显著。 Private LLM和Locally AI均提供快捷指令动作;PocketPal AI和MLC Chat截至2026年均为独立对话应用,不提供快捷指令动作。
Private LLM快捷指令:摘要所选文本
“1. 动作:"获取所选文本"(iOS分享菜单输入)。 2. 动作:"使用Private LLM生成文本" → 提示词:"将以下文本总结为三条要点:[所选文本]" → 模型:Phi-4 Mini。 3. 动作:"显示结果"或"复制到剪贴板"。 添加到分享菜单,即可在任意应用中对选中文本一键执行,完全离线。”
Apple Intelligence快捷指令:改写为专业语气
“1. 动作:"获取剪贴板"。 2. 动作:"使用模型" → 模型:设备端 → 提示词:"将以下内容改写为专业简洁的语气:[剪贴板]"。 3. 动作:"复制到剪贴板"。 添加到锁屏小组件,一键改写任意复制内容。”
- Private LLM 提供"使用Private LLM生成文本"快捷指令动作和"嘿Siri,问一下Private LLM [问题]"语音触发。付费对话应用中iOS原生集成最深。
- Locally AI 免费提供快捷指令动作,并可通过其Foundation Models集成将快捷指令路由至苹果自家设备端模型——没有语音触发,但无需付费即可获得快捷指令自动化。
- PocketPal AI 是独立对话应用——无快捷指令动作,无Siri集成。打开应用直接对话。快捷指令支持已在GitHub Issues中跟踪,但尚未发布。
- MLC Chat 是MLC LLM项目的参考应用——iOS集成极少,自2024年底以来也无更新。无快捷指令动作。
- LLM Farm 已从App Store下架(2025年8月),从源码编译后也没有快捷指令动作。
- Apple Intelligence 通过"使用模型"动作(iOS 18.4+,iOS 26起与Foundation Models框架一同扩展)与iOS快捷指令集成,可将提示词路由至设备端模型、Private Cloud Compute或ChatGPT(可配置)。设备端输出可链接至其他快捷指令动作。
- 侧载: PocketPal AI、Private LLM、Locally AI和MLC Chat均在App Store上架,无需侧载或越狱;Apple Intelligence内置于iOS。LLM Farm是例外——其安装现已需要在Xcode中从源码编译。根据DMA,欧盟用户在2026年也可通过替代应用市场安装App Store应用,但应用本身相同。
💡提示: 如需在驾车或烹饪时免提使用,Private LLM的"嘿Siri,问一下Private LLM"是唯一无需触碰手机即可使用的设备端选项。Apple Intelligence通过Siri支持语音,但仅限系统任务(写作、摘要、应用操作)——不像对话应用那样支持通用问答。
常见错误
- 安装超过iPhone内存承载能力的模型。 8 GB iPhone上运行7B模型,生成速度仅约3–5 tokens/秒,且其他应用需要内存时iOS会强制关闭该应用。请遵循对应iPhone档次的推荐模型(8 GB设备用3B–4B,6 GB设备用1.7B)。
- 期望设备端模型达到云端AI的质量。 Phi-4 Mini(3.8B)对于其体积已相当出色,但无法达到GPT-5.5的水平。适合用于对话、摘要、起草和快速问答——不适合多步推理、复杂代码生成或细腻的创意写作。
- 在阳光直射或高温车内运行推理。 数分钟内即触发热节流,生成速度下降30–50%,可能出现"iPhone需要冷却"提示。请在室温环境下运行推理。
- 同时安装3款以上对话应用,每个装着3 GB模型。 这会消耗约10 GB存储空间用于重复模型。先选定一款应用和一个模型,其余的在确认需要前先卸载。
- 误以为Apple Intelligence完全没有对话界面。 这在iOS 18之前是事实,但自iOS 26起,Locally AI等应用已可通过Foundation Models框架为苹果设备端模型提供真正的对话窗口。系统功能本身(写作工具、智能回复)仍不是对话界面。
- 在App Store上寻找LLM Farm。 它已于2025年8月下架。在App Store搜索只会浪费时间;同样的免费灵活场景请改用PocketPal AI,或若确实需要mirostat控制,可在Xcode中从源码编译LLM Farm。
参考资料
- PocketPal AI — github.com/a-ghorbani/pocketpal-ai(开源iOS应用)。
- Private LLM — App Store页面及开发者文档。
- Locally AI — App Store页面(LM Studio团队出品,基于Apple MLX)。
- MLC Chat / MLC LLM项目 — llm.mlc.ai(iOS Metal加速部署)。
- LLM Farm — github.com/guinmoon/LLMFarm(开源iOS应用;据项目README,App Store/TestFlight页面暂时不可用)。
- Apple Intelligence及设备端基础模型 — Apple机器学习研究及Apple开发者文档(Foundation Models框架,iOS 26引入)。
常见问题
iPhone真的能运行7B模型吗?
技术上可以,iPhone 15 Pro及更新机型(8 GB内存)可以运行,但速度不够实用。iPhone 16 Pro上,7B Q4模型生成速度仅约3–5 tokens/秒——对话体验很差。当其他应用需要内存时,iOS也容易强制关闭应用。日常设备端对话请使用3B–4B模型(Phi-4 Mini、Llama 3.2 3B、Gemma 3 4B)。如需7B以上的质量,可远程连接运行Ollama的家用Mac或PC。
本地AI会消耗iPhone电量吗?
会——主动推理消耗约3–5 W,iPhone 16 Pro每小时消耗约20–30%电量。偶尔使用(几条提示词)影响较小。持续使用(长对话、多次摘要任务)时请保持充电。模型驻留内存但不进行推理时,电池影响可忽略不计。
使用本地AI会导致iPhone发热吗?
会,持续生成约10–15分钟后会明显发热。芯片表面温度达约38°C时,iOS降低时钟频率,tokens/秒下降30–50%。建议:长时间使用时将iPhone屏幕朝上放在硬质平面上(不要握在手中),避免阳光直射。短时交互(5分钟以内)通常不会有明显发热。
可以用Siri控制本地模型吗?
可以,通过Private LLM($4.99买断)实现。说"嘿Siri,问一下Private LLM [问题]",提示词会发送至设备端模型,Siri朗读回答——全程离线。PocketPal AI、Locally AI和MLC Chat截至2026年不支持Siri语音集成,不过Locally AI支持快捷指令自动化。Apple Intelligence与Siri集成,但仅限系统任务(写作、摘要、应用操作),不支持通用问答。
这些应用能在iPhone SE或旧款iPhone上使用吗?
有限制。iPhone SE(4 GB内存)低于2026年设备端LLM的实用门槛。iPhone 14 / 15(非Pro,6 GB内存)可运行1.7B模型(Qwen3 1.7B、SmolLM 2 1.7B),但不能运行3B以上模型。iPhone 14 Pro和15 Pro(6–8 GB内存)可以约8–12 tokens/秒运行Phi-4 Mini等3B模型。旧款iPhone更好的选择是远程连接家用Mac或PC。
能在iPhone和Mac之间同步对话记录吗?
PocketPal AI、Private LLM和MLC Chat均不支持同步——对话记录存储在各设备本地,没有iCloud同步。Private LLM和Locally AI都是通用购买/下载,也能原生在Mac上运行,但iPhone版和Mac版之间的记录仍不会同步。跨设备共享对话记录的实用方案是在家用Mac上运行Open WebUI,从iPhone和Mac的浏览器访问——Open WebUI将对话记录存储在服务器端。
这些应用能在App Store以外获取吗?
PocketPal AI是开源项目,可通过Xcode从源码编译,但App Store版本是标准发行渠道。LLM Farm是例外,现已必须从源码编译——它已于2025年8月从App Store和TestFlight下架。Private LLM、Locally AI和MLC Chat仅在App Store上架。根据DMA,欧盟用户在2026年可通过替代应用市场安装App Store应用,但内容相同。
有哪款应用需要越狱?
不需要。PocketPal AI、Private LLM、Locally AI、MLC Chat和Apple Intelligence均可在标准iOS上运行。在Xcode中编译LLM Farm同样不需要越狱——它使用的是面向开发者的标准侧载流程,而非越狱漏洞。这些应用均不需要、也不建议越狱。
能在iOS快捷指令中使用本地AI吗?
可以,通过Private LLM("使用Private LLM生成文本"动作)、Locally AI(免费快捷指令动作)或Apple Intelligence("使用模型"动作,iOS 18.4+,iOS 26起扩展)实现。PocketPal AI和MLC Chat截至2026年不支持快捷指令动作。Locally AI是唯一同时免费提供快捷指令支持和苹果设备端模型访问的选项。
本地AI与iPhone上的ChatGPT应用相比如何?
设备端模型(Phi-4 Mini、Llama 3.2 3B)在复杂推理、广博世界知识和多模态任务上仍明显逊于前沿云端模型,但在简单问题上更快(无网络延迟),且完全私密。客观来说:本地AI适合日常和私密任务;偶尔遇到高难度问题时可用ChatGPT等云端应用。2026年很多用户两者都装着,按需选择。
LLM Farm不在App Store上架后还安全吗?
其源码在GitHub上公开,2026年间仍有issue活动,因此并未被放弃,但从源码编译并侧载后,就不再经过苹果的App Store审核流程。如果不是特别需要mirostat采样控制,PocketPal AI能覆盖同样免费、灵活、开源的使用场景,并保留在经过苹果标准审核的App Store中。
