Skip to main content
PromptQuorum

Raspberry Pi 5 能运行本地 LLM 吗?

Raspberry Pi 5 能运行本地 LLM 吗?

本页包含指向第三方产品的参考链接。PromptQuorum 未加入任何联盟计划——这些是不产生佣金的普通链接。点击链接和后续步骤由您自行承担责任。这些链接不代表 PromptQuorum 的任何认可或验证。

查看 Raspberry Pi 5 8GB 价格产品链接 · 已披露查看 Raspberry Pi AI HAT+ 2 价格产品链接 · 已披露

快速回答

可以。Pi 5(8GB)仅靠 CPU 通过 Ollama 或 llama.cpp 运行 1B-3B 模型——这大致是实用上限。加装官方 Raspberry Pi AI HAT+ 2(Hailo-10H NPU)可获得专用 GenAI 加速、自带的 Hailo Ollama 服务器,以及运行更大模型的余量。

  • 最佳经济型方案:Pi 5 8GB + 主动散热——尝试极小模型的最便宜方式。
  • 最佳 AI 方案:Pi 5 + Raspberry Pi AI HAT+ 2——为 GenAI 工作负载打造的专用 Hailo-10H NPU。
  • 仅用 Pi 5 时的模型范围:Q4 下约 1B-3B 参数——不要期待桌面级 GPU 的速度。
  • 最佳用途:私人常开助手、家庭自动化或离线实验——而非快速的日常聊天机器人。
Quick Answers中级

关键要点

  • 可以——8GB 版 Raspberry Pi 5 仅靠 CPU 通过 Ollama 或 llama.cpp 运行 1B-3B 模型
  • 官方 Raspberry Pi AI HAT+ 2 加入了专为设备端 GenAI 打造的 Hailo-10H NPU,并自带 Hailo Ollama 服务器
  • 请购买 8GB 配置——4GB 版本为模型加操作系统留出的余量太少
  • 对于任何持续的推理工作负载,而不仅是简短测试,主动散热都值得添加
  • 最佳用途:私人常开助手、家庭自动化或离线实验——而非快速的日常聊天机器人
  • 对于认真的 7B 及以上本地 LLM 使用,GPU PC 或迷你 PC 会胜过任何 Pi 5 配置

经济型方案:仅使用 Raspberry Pi 5

裸机 Raspberry Pi 5(8GB)可通过 Ollama 或 llama.cpp 运行 Q4 量化的 1B-3B 参数模型——如 Llama 3.2 1B、Llama 3.2 3B 或 Qwen3 1.7B。一切都在四核 CPU 上运行:Pi 5 集成的 VideoCore GPU 并非实用的 llama.cpp 加速器,因此裸机主板上没有明显的 GPU 加速效果。

社区基准测试显示,小型 Q4 模型在 Pi 5 CPU 上的速度约为每秒 4-9 个 token,具体取决于模型和运行环境——明显慢于桌面 GPU 推理,但对短查询和随意实验来说可用。

最适合:简单查询的离线助手、Home Assistant 实验、自动化脚本,以及学习本地推理的工作原理。请购买 8GB 配置——4GB 版本为模型加 Raspberry Pi OS 留出的余量太少。

查看 Raspberry Pi 5 8GB 价格产品链接 · 已披露

更优选择:Pi 5 + Raspberry Pi AI HAT+ 2

官方 Raspberry Pi AI HAT+ 2 通过加入 Hailo-10H NPU 和 8GB 专用内存,将 Pi 5 变成了一套专门打造的边缘 AI 系统。Raspberry Pi 官方文档确认了通过 Hailo GenAI Model Zoo 提供的 GenAI/LLM 支持,其中包括可通过网络或基于浏览器的聊天界面查询的 Hailo Ollama 服务器。

Hailo-10H 提供 40 TOPS 的 INT4 推理性能,并附带多个开箱即用的小型模型(约 1B-1.5B 参数,包括 Qwen2 和 Llama 3.2 的多个版本)——对于想要真正边缘 AI 设备而非业余实验的人来说,这是一条明显不同且更快的路径,而非仅靠 CPU 推理。

如果你想要专用的 GenAI 加速,并能接受一个仍在成熟中的软件栈,可以购买这套方案——Raspberry Pi 于 2026 年 1 月发布了 AI HAT+ 2,其文档中的软件包版本可能落后于 Hailo 自身的发布节奏。

查看 Raspberry Pi AI HAT+ 2 价格产品链接 · 已披露

Pi 5 对比 Pi 5 + AI HAT+ 2 对比 GPU PC

加装 AI HAT+ 2 缩小了与 GPU 的部分差距,但独立 GPU 或 GPU PC 在原始模型大小和速度上仍然胜出。

方案本地 AI 能力最适合
仅 Pi 51B-3B 模型,仅 CPU最便宜的实验、学习
Pi 5 + AI HAT+ 2专用 NPU,1B-1.5B GenAI 模型真正的边缘 AI 设备,专注 GenAI
GPU PC / 迷你 PC7B 及以上模型,速度快得多认真的日常本地 LLM 使用

持续推理的散热方案

持续的 CPU 或 NPU 密集型推理会让设备比日常使用时更热——如果你计划长时间运行推理而不只是简单测试,官方 Raspberry Pi 主动散热器(一款带温控风扇的卡扣式散热片)是一项便宜且有良好文档支持的补充配件。

常开服务器的 NVMe 存储

如果 Pi 成为一台常开的本地 AI 服务器,通过使用 Pi 5 PCIe 接口的官方 Raspberry Pi M.2 HAT+ 实现 NVMe 存储,在持续读写负载下比 microSD 卡更可靠——一旦你超越随意测试阶段,这项投入就值得。

查看 Raspberry Pi M.2 HAT+ 价格产品链接 · 已披露

实际能构建什么?

Pi 5 本地 LLM 方案适合私人家庭助手实验、家庭自动化集成(关于 Pi 级硬件上现实的延迟预期,参见我们的本地语音助手搭建指南)、简单的文档分类,以及不需要快速响应的常开离线服务。

结论

最便宜:裸机 Pi 5 8GB,用于 1B-3B 模型和实验。最佳 Pi 基础 AI 方案:Pi 5 + 官方 AI HAT+ 2,获得专用 Hailo-10H 加速。整体最佳性能:GPU PC 或专为本地 LLM 打造的迷你 PC——对于 7B 及以上模型,任何 Pi 配置都望尘莫及。

相关阅读

常见问题

Raspberry Pi 5 做 LLM 推理需要主动散热吗?
持续负载下需要。持续的 CPU 或 NPU 密集型推理会让 Pi 5 比日常使用时更热,官方主动散热器对于较长的推理会话来说是一项便宜且值得的补充配件。
Raspberry Pi AI HAT+ 2 真的支持 LLM 吗?
是的——经 Raspberry Pi 官方文档确认。AI HAT+ 2 的 Hailo-10H NPU 通过 Hailo GenAI Model Zoo 软件包和 Hailo Ollama 服务器运行一组有文档记录的小型模型(约 1B-1.5B 参数),可通过 API 调用或基于浏览器的聊天界面访问。
Ollama 是在 Raspberry Pi 5 上运行 LLM 的最佳方式吗?
对于裸机 Pi 5 上仅使用 CPU 的推理,Ollama 是最简单的选择。llama.cpp 在量化和编译选项上提供更多手动控制。AI HAT+ 2 使用自己独立的 Hailo Ollama 服务器,而非标准的 Ollama CPU 路径。
Raspberry Pi 5 适合搭配本地 LLM 运行语音助手吗?
只有在使用非常小的模型和现实的延迟预期下才可行——参见我们的本地语音助手搭建指南,其中将仅用 CPU 的 Pi 5 列为多个硬件等级之一,与更快的迷你 PC、GPU 和 Mac 选项并列。
Pi 5 上运行任何本地 LLM 的最低内存要求是多少?
8GB 配置是获得舒适体验的实际最低要求。4GB 配置技术上可以加载一个 1B 模型,但为设备上运行的其他任何东西留出的余量非常少。