Raspberry Pi 5 能运行本地 LLM 吗?

本页包含指向第三方产品的参考链接。PromptQuorum 未加入任何联盟计划——这些是不产生佣金的普通链接。点击链接和后续步骤由您自行承担责任。这些链接不代表 PromptQuorum 的任何认可或验证。
快速回答
可以。Pi 5(8GB)仅靠 CPU 通过 Ollama 或 llama.cpp 运行 1B-3B 模型——这大致是实用上限。加装官方 Raspberry Pi AI HAT+ 2(Hailo-10H NPU)可获得专用 GenAI 加速、自带的 Hailo Ollama 服务器,以及运行更大模型的余量。
- ▸最佳经济型方案:Pi 5 8GB + 主动散热——尝试极小模型的最便宜方式。
- ▸最佳 AI 方案:Pi 5 + Raspberry Pi AI HAT+ 2——为 GenAI 工作负载打造的专用 Hailo-10H NPU。
- ▸仅用 Pi 5 时的模型范围:Q4 下约 1B-3B 参数——不要期待桌面级 GPU 的速度。
- ▸最佳用途:私人常开助手、家庭自动化或离线实验——而非快速的日常聊天机器人。
关键要点
- ✓可以——8GB 版 Raspberry Pi 5 仅靠 CPU 通过 Ollama 或 llama.cpp 运行 1B-3B 模型
- ✓官方 Raspberry Pi AI HAT+ 2 加入了专为设备端 GenAI 打造的 Hailo-10H NPU,并自带 Hailo Ollama 服务器
- ✓请购买 8GB 配置——4GB 版本为模型加操作系统留出的余量太少
- ✓对于任何持续的推理工作负载,而不仅是简短测试,主动散热都值得添加
- ✓最佳用途:私人常开助手、家庭自动化或离线实验——而非快速的日常聊天机器人
- ✓对于认真的 7B 及以上本地 LLM 使用,GPU PC 或迷你 PC 会胜过任何 Pi 5 配置
经济型方案:仅使用 Raspberry Pi 5
裸机 Raspberry Pi 5(8GB)可通过 Ollama 或 llama.cpp 运行 Q4 量化的 1B-3B 参数模型——如 Llama 3.2 1B、Llama 3.2 3B 或 Qwen3 1.7B。一切都在四核 CPU 上运行:Pi 5 集成的 VideoCore GPU 并非实用的 llama.cpp 加速器,因此裸机主板上没有明显的 GPU 加速效果。
社区基准测试显示,小型 Q4 模型在 Pi 5 CPU 上的速度约为每秒 4-9 个 token,具体取决于模型和运行环境——明显慢于桌面 GPU 推理,但对短查询和随意实验来说可用。
最适合:简单查询的离线助手、Home Assistant 实验、自动化脚本,以及学习本地推理的工作原理。请购买 8GB 配置——4GB 版本为模型加 Raspberry Pi OS 留出的余量太少。
更优选择:Pi 5 + Raspberry Pi AI HAT+ 2
官方 Raspberry Pi AI HAT+ 2 通过加入 Hailo-10H NPU 和 8GB 专用内存,将 Pi 5 变成了一套专门打造的边缘 AI 系统。Raspberry Pi 官方文档确认了通过 Hailo GenAI Model Zoo 提供的 GenAI/LLM 支持,其中包括可通过网络或基于浏览器的聊天界面查询的 Hailo Ollama 服务器。
Hailo-10H 提供 40 TOPS 的 INT4 推理性能,并附带多个开箱即用的小型模型(约 1B-1.5B 参数,包括 Qwen2 和 Llama 3.2 的多个版本)——对于想要真正边缘 AI 设备而非业余实验的人来说,这是一条明显不同且更快的路径,而非仅靠 CPU 推理。
如果你想要专用的 GenAI 加速,并能接受一个仍在成熟中的软件栈,可以购买这套方案——Raspberry Pi 于 2026 年 1 月发布了 AI HAT+ 2,其文档中的软件包版本可能落后于 Hailo 自身的发布节奏。
Pi 5 对比 Pi 5 + AI HAT+ 2 对比 GPU PC
加装 AI HAT+ 2 缩小了与 GPU 的部分差距,但独立 GPU 或 GPU PC 在原始模型大小和速度上仍然胜出。
| 方案 | 本地 AI 能力 | 最适合 |
|---|---|---|
| 仅 Pi 5 | 1B-3B 模型,仅 CPU | 最便宜的实验、学习 |
| Pi 5 + AI HAT+ 2 | 专用 NPU,1B-1.5B GenAI 模型 | 真正的边缘 AI 设备,专注 GenAI |
| GPU PC / 迷你 PC | 7B 及以上模型,速度快得多 | 认真的日常本地 LLM 使用 |
持续推理的散热方案
持续的 CPU 或 NPU 密集型推理会让设备比日常使用时更热——如果你计划长时间运行推理而不只是简单测试,官方 Raspberry Pi 主动散热器(一款带温控风扇的卡扣式散热片)是一项便宜且有良好文档支持的补充配件。
常开服务器的 NVMe 存储
如果 Pi 成为一台常开的本地 AI 服务器,通过使用 Pi 5 PCIe 接口的官方 Raspberry Pi M.2 HAT+ 实现 NVMe 存储,在持续读写负载下比 microSD 卡更可靠——一旦你超越随意测试阶段,这项投入就值得。
实际能构建什么?
Pi 5 本地 LLM 方案适合私人家庭助手实验、家庭自动化集成(关于 Pi 级硬件上现实的延迟预期,参见我们的本地语音助手搭建指南)、简单的文档分类,以及不需要快速响应的常开离线服务。
结论
最便宜:裸机 Pi 5 8GB,用于 1B-3B 模型和实验。最佳 Pi 基础 AI 方案:Pi 5 + 官方 AI HAT+ 2,获得专用 Hailo-10H 加速。整体最佳性能:GPU PC 或专为本地 LLM 打造的迷你 PC——对于 7B 及以上模型,任何 Pi 配置都望尘莫及。
相关阅读
- ▸6 GB 显存的最佳本地 LLM — 真正实用的低预算 GPU 替代方案
- ▸7B 模型需要多少内存? — 为什么 7B 对 Pi 5 的 CPU 来说遥不可及
- ▸常开 Ollama 服务器的最佳迷你 PC — 更实用的常开替代方案
- ▸搭建本地语音助手 — Pi、迷你 PC 和 GPU 各硬件等级的真实延迟表现
常见问题
Raspberry Pi 5 做 LLM 推理需要主动散热吗?▾
Raspberry Pi AI HAT+ 2 真的支持 LLM 吗?▾
Ollama 是在 Raspberry Pi 5 上运行 LLM 的最佳方式吗?▾
Raspberry Pi 5 适合搭配本地 LLM 运行语音助手吗?▾
Pi 5 上运行任何本地 LLM 的最低内存要求是多少?▾
相关 Prompt Bites