关键要点
- 4GB内存,纯CPU: Qwen3 1.7B Q4_K_M——25–40 tok/s。最低硬件下最快响应。
- 8GB内存,纯CPU(最佳选择): Phi-4-mini 3.8B Q4_K_M——15–25 tok/s。旧笔记本上处理编程和推理。
- 8GB内存 + Intel Iris核显: Qwen3 4B——部分GPU卸载下12–20 tok/s。
- 16GB内存,纯CPU: Qwen3 8B Q4_K_M——8–15 tok/s。质量出色,无需GPU。
- 16GB内存 + 核显: Llama 3.2 3B或Qwen3 4B——层卸载下20–35 tok/s。
- 结论: 对大多数低配电脑而言,Phi-4-mini(3.8B)配Q4_K_M是最佳选择——适合8GB内存,CPU上15–25 tok/s。想要最快响应可切换至Qwen3 1.7B。
- 费用: 全部免费(开源),对比ChatGPT API(约$0.002/1K词元)。
📍 简单一句话
8 GB内存纯CPU电脑上,Phi-4-mini 3.8B Q4_K_M以15–25 tok/s处理编程和推理;4 GB内存上,Qwen3 1.7B Q4_K_M达25–40 tok/s。
💬 简单来说
运行本地AI不需要游戏GPU。这些模型完全在CPU和普通内存上运行。小型模型(1–4B参数)在日常任务上出乎意料地强大,速度足以支持真实对话。
适合您硬件的最快模型是什么?
将您的硬件与正确的模型匹配——错误的选择会损失4–10倍的速度。除非另有说明,以下所有层级均为纯CPU。
| 您的硬件 | 推荐模型 | Ollama命令 | 预期速度 |
|---|---|---|---|
| 4GB内存,纯CPU | Qwen3 1.7B Q4_K_M | ollama run qwen3:1.7b | 25–40 tok/s |
| 8GB内存,纯CPU | Phi-4-mini 3.8B Q4_K_M | ollama run phi4-mini | 15–25 tok/s |
| 8GB内存 + Intel Iris核显 | Qwen3 4B Q4_K_M | ollama run qwen3:4b | 12–20 tok/s |
| 16GB内存,纯CPU | Qwen3 8B Q4_K_M | ollama run qwen3:8b | 8–15 tok/s |
| 16GB内存 + 核显 | Llama 3.2 3B Q4_K_M | ollama run llama3.2:3b | 20–35 tok/s |
您应该使用哪种模型?
将您的情况与正确的模型匹配——这是最重要的决定:
- 8GB内存笔记本(无独立显卡): Phi-4-mini(3.8B)配Q4_K_M——15–25 tok/s,可处理编程和推理。`ollama run phi4-mini`
- 4GB内存,非常旧的电脑: Qwen3 1.7B Q4_K_M——25–40 tok/s,最低内存下最快响应。`ollama run qwen3:1.7b`
- 16GB内存,无GPU: Qwen3 8B Q4_K_M——8–15 tok/s,质量出色。`ollama run qwen3:8b`
- 8GB内存 + Intel Iris核显: Qwen3 4B——使用`OLLAMA_NUM_GPU=1`实现部分卸载,12–20 tok/s。`ollama run qwen3:4b`
- 需要多语言支持(128K上下文): Qwen3 4B或Llama 3.2 3B——两者在Ollama上均支持128K上下文。
- 关于按内存层级的推荐和散热管理,请参阅 如何在笔记本电脑上运行本地LLM。
您应在您的硬件上运行哪种本地LLM?
以下所有层级均为纯CPU或核显。选择在Q4_K_M下能适配您内存的最大模型——量化对质量的影响小于换用更小的模型。
| 硬件 | Model | Quant | Speed | Experience |
|---|---|---|---|---|
| 4GB内存,纯CPU | Qwen3 1.7B | Q4_K_M | 25–40 t/s | 快速,质量可用 |
| 8GB内存,纯CPU | Phi-4-mini 3.8B | Q4_K_M | 15–25 t/s | 编程+推理 |
| 8GB内存 + 核显Iris | Qwen3 4B | Q4_K_M | 12–20 t/s | 部分GPU卸载 |
| 16GB内存,纯CPU | Qwen3 8B | Q4_K_M | 8–15 t/s | 质量出色 |
| 16GB内存 + 核显 | Llama 3.2 3B | Q4_K_M | 20–35 t/s | 核显下流畅 |

GPU vs CPU:低配硬件上哪个更快?
GPU推理: RTX 3060上15-20词元/秒。需要CUDA配置。速度快,质量最佳。参见经济型GPU指南。
集显(集成显卡): Intel Iris上5-8词元/秒。无需额外配置。比独显慢。
CPU推理: 现代多核CPU上1-5词元/秒。可在任何地方运行。最慢。
规则: 如果有任何GPU(即使是集显),就使用它。CPU是最后手段。

为什么小模型在低配PC上更快
模型大小直接决定速度。 1B-3B模型完全适合系统RAM,CPU或GPU可以持续流式传输数据。较大的模型需要内存交换——在RAM和磁盘之间移动数据——这会使生成速度降低10-100倍(瓶颈是磁盘I/O,而非计算)。
上方的硬件决策表体现了这一原则:TinyLlama 1.1B(1B参数)在旧CPU上可达5-10词元/秒,而13B+模型在低配硬件上不切实际,因为内存交换占主导。
- 1B-3B模型: 适合4-8GB RAM → 生成最快 → 质量可接受
- 7B模型: 在8GB系统上处于临界 → 因内存压力而较慢 → 质量高
- 13B+模型: 需要16GB+ VRAM或大量内存交换 → 交互式使用速度过慢
低配PC上本地LLM有多快?
纯CPU系统预期:
- 3B模型 → 15-40词元/秒(旧CPU:10-15,优化后的新CPU:30-40)
- 7B模型 → 10-25词元/秒(取决于CPU核心数和量化;积极优化后部分可达30+)
- 这比云API慢(ChatGPT 4o:80-150词元/秒),但足以满足交互式使用。 3B模型以25词元/秒生成500词元响应需20秒——对于代码审查、摘要和创意写作等非时间敏感任务可接受。
量化如何影响低配PC的速度?
Q4(4位): 约1%质量损失,50% VRAM节省。标准选择。所有量化级别的详细说明见完整指南。
Q3(3位): 约3%质量损失,62% VRAM节省。聊天可接受。
Q2(2位): 约10%质量损失,75% VRAM节省。有风险;仅在内存不足时使用。
速度影响: Q2比Q4快约30%,因为内存带宽更少,而非计算量减少。
策略:对大模型量化(Mistral Small Q2)优于使用微小模型(TinyLlama)。
Mistral Small Q2在速度和质量上均优于TinyLlama 1.1B Q4。
快速模型以牺牲质量来换取速度——但通过调整温度和top-p,您可以恢复大部分质量。在快速模型上使用较低的温度(0.1-0.3)会产生比默认设置更一致的输出。参阅温度和top-p解析了解确切设置。
如何加速纯CPU推理?
- 启用AVX-512: 如果CPU支持,使用 `LLAMACPP_AVX512=1 ollama run phi`。约20%加速。
- 减少上下文窗口: 上下文越短 = 越快。使用 `--ctx-size 1024` 代替4096。
- **使用llama.cpp代替Ollama:** CPU上略快(约10%提升),开销更少。
- 禁用多线程: 反直觉,但在弱CPU上,单线程更快(无线程开销)。
- 卸载到集显: 即使弱集显也优于CPU。通过 `lspci` 检查GPU可用性。
这些模型有多快?真实基准(2026年7月)
按硬件层级的真实测量,2026年7月。均使用Ollama默认设置,无调优。均为纯CPU或核显——无独立显卡:
- 4GB内存,纯CPU(Intel N100迷你主机)+ Qwen3 1.7B Q4_K_M:25–35 tok/s。`ollama run qwen3:1.7b`
- 8GB内存,纯CPU(Core i5-1235U)+ Phi-4-mini Q4_K_M:15–22 tok/s。`ollama run phi4-mini`
- 8GB内存,纯CPU(配Radeon核显的Ryzen 5 5600G)+ Qwen3 4B Q4_K_M:层卸载下18–25 tok/s。
- 8GB内存 + Intel Iris Xe(第12代i5)+ Qwen3 4B Q4_K_M:12–18 tok/s。`ollama run qwen3:4b`
- 16GB内存,纯CPU(Ryzen 7 7700X)+ Qwen3 8B Q4_K_M:8–13 tok/s。`ollama run qwen3:8b`
- 16GB内存 + 核显Iris Xe + Llama 3.2 3B Q4_K_M:20–30 tok/s。`ollama run llama3.2:3b`
对本地LLM来说什么才算真正的"快"?
速度的感受因任务而异——可参考以下标准:
如果您的模型速度低于15 tok/s,请在购买新硬件之前先缩小模型规模(7B → 3B)或降低一级量化(Q5 → Q4)。
- 低于10 tok/s → 感觉卡顿。 词语逐个出现,停顿明显。无法用于交互式聊天。
- 15–25 tok/s → 可接受。 对大多数用户来说速度可读。适合问答、摘要和编程辅助。
- 30+ tok/s → 流畅。 感觉像真实助手。对所有交互任务都很舒适。
- 60+ tok/s → 即时。 比阅读速度还快。适合实时自动补全和快速迭代。
低配PC上应避免什么
- 不要运行13B+模型——它们超出RAM限制。 Q4下13B模型需要8-10GB VRAM,超出实际低配PC容量。即使使用激进的Q2量化,13B模型也需要5-6GB,OS和GPU调度开销的余量不足。坚持使用7B及以下。
- 避免Q8量化——速度更慢,质量提升微乎其微。 Q8使用的VRAM几乎是Q4的2倍(Mistral Small为8GB vs 5.5GB),质量仅提升约2%。对于4GB系统,Q8不切实际;对于8GB系统,Q4仍是最优。Q3是Q4内存不足时唯一值得考虑的权衡。
- 不要期望实时自动补全性能。 在CPU上以3词元/秒的速度,生成50个词元需要16秒。交互式自动补全需要≥20词元/秒。低配CPU上的本地LLM适用于批量聊天、起草和审查——而非实时自动补全或边输入边生成代码的场景。
- 不要将纯CPU推理用于生产聊天机器人。 适用于内部工具、原型和离线批处理。云API(15-20毫秒延迟)在面向用户的服务上优于低配CPU(300+毫秒延迟)。将本地推理用于隐私关键或离线场景,而非速度关键场景。
常见错误
- 错误:为了CPU速度选择TinyLlama。 问题:TinyLlama属于4GB VRAM档位,而非CPU档位——Phi-4-mini 3.8B在纯CPU硬件上更快且明显更好。解决方案:在CPU上运行Phi-4-mini 3.8B;将TinyLlama Q5留给4GB VRAM场景。
- 错误:未启用CPU加速标志。 问题:缺少AVX/NEON启用可带来20%加速且无成本。解决方案:在运行Ollama前设置 `LLAMACPP_AVX512=1` 或 `LLAMACPP_NEON=1`。
- 错误:量化到Q2以将7B强塞进4GB。 问题:Q2量化由于推理时KV缓存开销常导致内存溢出崩溃。解决方案:改用Q4的3B模型。
- 错误:假设更新的硬件总是意味着更快的推理。 问题:桌面Ryzen并不比移动ARM每词元更快,因为桌面软件缺乏内存优化。解决方案:对您的实际硬件进行基准测试。
- 错误:使用错误的Ollama slug。 问题:`ollama run phi` 加载的是Phi-2,而非Phi-4-mini。解决方案:使用`ollama run phi4-mini`获取最新的Phi模型。始终在ollama.com/library查看精确的模型标签。
低配PC本地LLM:地区背景
中国(数据安全法): 根据2021年《数据安全法》和《个人信息保护法》(PIPL),在消费级硬件上运行Qwen3和DeepSeek-R1是金融、医疗和法律行业企业合规的首选部署模式。本地推理确保数据不离开设备,满足数据本地化要求,无需依赖境外云服务。Qwen3 1.7B和4B可在纯CPU硬件上运行,为硬件受限用户提供可行的替代方案。
欧盟 / GDPR: 在低配硬件上本地运行:推理数据不离开设备——对许多中小企业和自由职业者而言,这是规避GDPR第44条数据转移风险的技术简便方法。欧盟AI法案(自2025年2月起生效)对个人使用的推理不施加文档要求。数据保护的整体合规性仍取决于您的整体运营方式,而非仅推理架构本身。
日本(METI AI治理): 经济产业省(METI)的AI治理指南鼓励数据最小化。低配硬件上的CPU推理满足最严格的数据主权要求——无API调用、无日志记录、无第三方数据访问。对于使用CPU运行Qwen3处理日语任务的用户,1–3词元/秒的吞吐量对非实时文档摘要来说已经足够。
关于在低配PC上运行本地LLM的常见问题
运行本地LLM,什么算作低配PC?
低配PC是指没有独立显卡(纯CPU)、系统内存为4–16GB的机器。包括大多数配备Intel Iris或AMD Radeon集成显卡的笔记本电脑、没有独立显卡的旧款台式机,以及Intel N100等迷你主机。关键限制是用于存储模型权重的系统内存,而非CPU时钟频率。
我可以在完全没有GPU的情况下运行7B级模型吗?
可以——Qwen3 8B(Q4_K_M)在16GB内存、纯CPU下可达8–15 tok/s(在Ryzen 7 7700X上测试)。它比更小的选项慢,但质量明显更好。若只有8GB内存,建议改用Phi-4-mini(3.8B)——8B模型在Q4_K_M下需要的余量,8GB系统未必能可靠保证。
CPU推理适合聊天机器人吗?
只要选对模型大小,适合交互式使用。Phi-4-mini(15–25 tok/s,8GB内存)和Qwen3 1.7B(25–40 tok/s,4GB内存)都足够快,可用于实时聊天。CPU上的7B级模型(8–15 tok/s)更适合起草、摘要、离线审阅等批处理任务,而非实时对话。
在纯CPU硬件上应该使用Phi-4-mini还是Qwen3 1.7B?
如果有8GB内存,使用Phi-4-mini(3.8B)——它以15–25 tok/s处理编程和推理。如果只有4GB内存,或想要最快的响应速度(25–40 tok/s),可以使用Qwen3 1.7B,但在复杂任务上质量会有所牺牲。
如何检查我是否有任何GPU?
对于独立NVIDIA显卡,在终端运行`nvidia-smi`。如果返回"command not found",请检查`lspci`(Linux)或设备管理器(Windows)是否有Intel Iris Xe或AMD Radeon核显——即使没有CUDA支持,这些核显仍可卸载部分层。
量化如何影响推理速度?
量化主要减少内存带宽需求,而非计算量。Q2(2位)比Q4(4位)快约30%,因为模型每次前向传播加载的字节更少。但Q2带来约10%的质量损失。实用规则:本指南中每个层级都默认使用Q4_K_M,只有在Q4_K_M无法放入可用内存时才降至Q3。
我可以使用Q2以下的量化吗?
技术上可以(Q1),但质量会灾难性下降——准确率损失高达30%。包括本指南的4GB内存层级在内,不建议用于任何实际场景。
支持CPU + 核显混合推理吗?
是的,通过层卸载实现。在配备Intel Iris Xe核显的8GB内存系统上,Qwen3 4B在部分卸载下可达12–20 tok/s,优于纯CPU。设置`OLLAMA_NUM_GPU=1`,Ollama会自动卸载适合的层。
低配电脑最快的本地LLM是什么?
Qwen3 1.7B(Q4_K_M)是本指南中最快的模型——在现代i5/Ryzen 5、4GB内存、无GPU的情况下达25–40 tok/s。若追求相近速度下更好的质量,Phi-4-mini(3.8B)在8GB内存下以15–25 tok/s运行,编程和推理表现明显更佳。
我可以在4GB内存上运行本地LLM吗?
可以——Qwen3 1.7B(Q4_K_M)是4GB内存、纯CPU场景下的推荐选择,在现代i5/Ryzen 5上可达25–40 tok/s。它是本指南中最快的模型,且为操作系统留有余量。
速度一定需要GPU吗?
不需要——本指南所有模型均可仅用CPU运行。Intel Iris核显能带来明显的速度提升(Qwen3 4B:部分卸载下12–20 tok/s,对比纯CPU),但仅是可选项。像二手RTX 4060 8GB这样的独立显卡比任何CPU配置快5–10倍,但这是一条独立的升级路径,而非必需条件。
参考资料
- Phi-4 Mini模型卡 — 微软研究院。MMLU 68%,HumanEval 70%。2025年发布。
- Gemma 3模型卡 — Google DeepMind。Gemma 3 2B,128K上下文窗口。2025年发布。
- Llama 4 Scout 8B — Meta。1000万词元上下文窗口,2026年3月发布。
- TinyLlama 1.1B仓库 — Stability AI。2024年完成训练。模型稳定,无进一步更新。仍推荐用于4GB VRAM层级。
- llama.cpp CPU优化指南 — CPU加速标志,包括AVX-512、NEON和线程配置。
