关键要点
- 全新(2026年8月25日):Mac mini M5 Pro起售价1,699美元(最高64GB,307 GB/s)——史上最便宜的M5 Pro Mac。
- 已确认,2026年9月22日发售:Mac Studio M5 Max起售价2,499美元(最高128GB,614 GB/s),Mac Studio M5 Ultra起售价5,499美元(最高512GB——512GB配置于2026年10月下旬发售,价格预计远超10,000美元)。
- Mac Studio不再提供M5 Pro级别——现在从M5 Max起步。Mac mini成为M5 Pro芯片的新入门选择。
- MacBook Pro 16" M5 Max(2026年3月起在售)与Mac Studio M5 Max带宽完全相同:460 GB/s(32核GPU)和614 GB/s(40核GPU),两种机型均相同。
- 所有M5 Pro/Max配置:307-614 GB/s内存带宽。M5 Ultra最高可达1.2 TB/s。
- 静音运行:MacBook Pro推理时风扇会启动;Mac Studio和Mac mini风扇很少转动。
- 在M5上MLX最快。Ollama在Apple Silicon上自动使用MLX后端。
- 统一内存:从24GB(Mac mini M5 Pro基础版)到512GB(Mac Studio M5 Ultra)均可用于任何模型。
📍 简单一句话
MacBook Pro 16英寸M5 Max(64–128 GB)以8–12 tok/s的速度运行Llama 3.3 70B Q4,内存带宽460–614 GB/s,功耗65–100W — 售价3,499–4,499美元,现已上市。
💬 简单来说
Apple Silicon Mac采用统一内存架构 — CPU、GPU和AI引擎共享同一高速内存池。这使其在AI方面效率极高:128 GB M5 Max可将完整的70B模型加载到内存中,而没有任何NVIDIA GPU能在相同功耗水平下实现这一点。
🔄 2026年8月26日更新:Apple于2026年8月25日的硬件更新首次为Mac mini配备M5 Pro芯片(起售价1,699美元,最高64GB),并确认了Mac Studio M5 Max(起售价2,499美元,最高128GB)以及全新的Mac Studio M5 Ultra(起售价5,499美元,最高512GB——512GB配置于2026年10月下旬发售)。Mac Studio不再包含M5 Pro级别。目前尚无针对全新Mac mini和Mac Studio的独立第三方基准测试;本文的tokens/秒数据除特别说明外,仍基于MacBook Pro 16" M5 Max(2026年3月起在售)的测试结果。
为什么Apple Silicon M5对本地LLM如此重要
Apple Silicon为AI工作负载采用了截然不同的架构。以下是它对本地LLM用户重要的原因。
- 统一内存架构: M5 Pro和M5 Max共享一个CPU、GPU和神经网络引擎可同时访问的高速内存池(24GB至128GB)。没有VRAM/RAM瓶颈,模型常驻高速内存,推理保持响应迅速。
- 内存带宽才是真正的瓶颈: 现代LLM推理受内存带宽限制,而非算力限制。M5 Max的460-614 GB/s带宽在24GB与128GB容量差距下,仍能与RTX 4090(1008 GB/s显存带宽)直接竞争。统一内存让每个字节都物尽其用。
- Apple Fusion架构(M5全新特性): M5 Pro和M5 Max将CPU和GPU分离为同一封装内的独立3nm芯片,实现独立扩展与热优化。相比单芯片设计,这种模块化设计提升了能效并减少了废热。
- 每个GPU核心都配备神经加速器: 每个GPU核心都内置专用神经加速器,与共享的神经网络引擎相辅相成。这种分布式架构能加速整个GPU(而不仅是专用核心)上的机器学习运算,改善LLM推理中的Transformer和注意力机制。
- 相较M4的性能提升: Apple宣称多线程性能相较M4 Pro和M4 Max提升高达30%。实际LLM推理测试显示,得益于内存带宽提升和架构改进,提升幅度达2-3倍。
- Thunderbolt 5连接(M5 Pro/Max): M5 Pro和M5 Max配备基础带宽80 Gbps的Thunderbolt 5(是Thunderbolt 4的两倍)。支持高速外部存储、多显示器和eGPU扩展(需软件支持)。
- 通过Apple N1芯片实现Wi-Fi 7和蓝牙6: M5系统内置全新N1无线芯片,支持Wi-Fi 7(最高5.8 Gbps)和低延迟的蓝牙6.0连接。使用远程推理客户端或云端模型API时响应更快。
- MLX框架快速成熟: Apple的Metal Learning eXtended(MLX)框架现已支持Llama 3.3、Qwen、Mistral、Gemma,并配有优化内核。Ollama(2026年5月版)可在Apple Silicon上自动检测并使用MLX,无需手动配置。
- 能效优势真实可见: M5 Max在满载推理下预计消耗65-100W。持续推理一个月(720小时)在美国电费约为8-12美元。RTX 4090(350W)同样一个月则需40-60美元。
- 静音运行: Mac Studio M5风扇空闲时30分贝,即使在高负荷LLM推理下也很少超过40分贝。MacBook Pro即使放在腿上使用也足够凉爽。
- 更好的保值率: 二手M1/M2/M3 Mac在2-3年后仍能保持原价的50-60%。二手RTX 4090由于挖矿历史和CUDA版本更迭,价值会跌至40-50%。
Apple Silicon M5对比表
以下所有配置均为Apple自2026年8月25日发布会以来确认的真实售价——没有一项是预测值。Mac mini、Mac Studio、MacBook Pro均于2026年9月22日发售,Mac Studio M5 Ultra 512GB配置除外(2026年10月下旬发售)。目前尚无针对全新Mac mini和Mac Studio的独立tokens/秒基准测试。
| 配置 | 芯片 | GPU核心 | 内存 | 带宽 | 价格 | 最适合 |
|---|---|---|---|---|---|---|
| Mac mini M5 Pro 24GB | M5 Pro | 16 | 24GB统一内存 | 307 GB/s | $1,699 | 最便宜的M5 Pro,7B-13B |
| Mac mini M5 Pro 64GB | M5 Pro | 20 | 64GB统一内存 | 307 GB/s | $2,699 | 30B模型,64GB性价比高 |
| Mac Studio M5 Max 36GB | M5 Max | 32 | 36GB统一内存 | 460 GB/s | $2,499 | 经济型桌面入门 |
| Mac Studio M5 Max 128GB | M5 Max | 40 | 128GB统一内存 | 614 GB/s | $5,099 | 70B Q5,高级用户 |
| Mac Studio M5 Ultra 96GB | M5 Ultra | 64 | 96GB统一内存 | 最高1.2 TB/s | $5,499 | 最大规模本地模型 |
| Mac Studio M5 Ultra 512GB | M5 Ultra | 80 | 512GB统一内存 | 最高1.2 TB/s | $10,000+(预估) | 超大模型,10月下旬发售 |
| MacBook Pro 16" M5 Max 64GB | M5 Max | 32 | 64GB统一内存 | 460 GB/s | $3,499 | 便携,70B Q4 |
| MacBook Pro 16" M5 Max 128GB | M5 Max | 40 | 128GB统一内存 | 614 GB/s | $4,499 | 便携,70B Q5 |

Mac mini M5 Pro:本地LLM全新经济入门之选
2026年8月25日,Apple首次为Mac mini配备M5 Pro芯片——此前M5 Pro仅在MacBook Pro上提供。售价1,699-2,699美元,配备24-64GB统一内存,Mac mini M5 Pro现已成为触及M5 Pro 64GB上限最便宜的方式,价格低于MacBook Pro M5 Pro,也低于已不复存在的"Mac Studio M5 Pro"设想(Mac Studio现在从M5 Max起步)。2026年9月22日发售。
- CPU: 15核或18核M5 Pro
- GPU: 16核或20核M5 Pro GPU
- 内存: 24GB基础版,可配置到48GB或64GB DDR5统一内存
- 内存带宽: 307 GB/s(与MacBook Pro上的M5 Pro完全相同)
- 存储: 512GB-2TB SSD(可配置)
- 接口: Thunderbolt 5(Mac mini新特性)
- 连接: Wi-Fi 7、蓝牙6
- 价格: $1,699(16核GPU,24GB);$1,899(20核GPU,24GB);升级到64GB需+$1,000
- 发售: 2026年9月22日
Mac Studio M5 Max 36GB:基础配置
2026年8月25日确认:Mac Studio M5 Max基础配置售价2,499美元,32核GPU,固定36GB统一内存(该GPU档位不提供内存升级选项;需更多内存须升级至40核档位)。2026年9月22日发售。Mac Studio不再提供M5 Pro级别——现在是最便宜的Mac Studio。
- CPU: 18核M5 Max
- GPU: 32核M5 Max GPU
- 内存: 36GB统一内存(该档位固定)
- 内存带宽: 460 GB/s(与MacBook Pro上32核M5 Max完全相同)
- 存储: 512GB-8TB SSD(可配置)
- 接口: Thunderbolt 5
- 价格: $2,499
- 发售: 2026年9月22日
Mac Studio M5 Max 48-128GB:本地LLM最佳性价比
2026年8月25日确认:40核GPU的Mac Studio M5 Max起售价3,099美元(48GB),配置到128GB为5,099美元。这才是真正为70B提供最佳性价比的档位;64GB在该档位内售价3,499美元。2026年9月22日发售。
- CPU: 18核M5 Max
- GPU: 40核M5 Max GPU
- 内存: 48GB基础版,可配置到64GB或128GB DDR5统一内存
- 内存带宽: 614 GB/s(与MacBook Pro上40核M5 Max完全相同)
- 存储: 512GB-8TB SSD
- 接口: Thunderbolt 5
- 价格: $3,099(48GB);$3,499(64GB);$5,099(128GB)
- 发售: 2026年9月22日
Mac Studio M5 Ultra:全新最强性能档位
2026年8月25日全新登场:Mac Studio M5 Ultra是位于M5 Max之上的全新档位,起售价5,499美元(96GB),最高可扩展至512GB。512GB配置于2026年10月下旬发售,价格预计远超10,000美元。这是首款搭载M5 Ultra芯片的Mac,也是首款提供512GB统一内存的Mac。
- CPU: 最高36核M5 Ultra
- GPU: 最高80核M5 Ultra GPU
- 内存: 96GB基础版,现可配置到256GB,512GB将于2026年10月下旬提供
- 内存带宽: 最高1.2 TB/s
- 存储: 1TB-16TB SSD
- 接口: Thunderbolt 5
- 价格: $5,499(96GB);512GB价格预计远超10,000美元
- 发售: 2026年9月22日(96-256GB);2026年10月下旬(512GB)
MacBook Pro 16英寸 M5 Max:便携本地LLM
MacBook Pro 16英寸M5 Max($3,499-4,499)以便携形态提供与Mac Studio M5 Max相同的算力。两种机型之间内存带宽完全相同——32核GPU档位为460 GB/s,40核档位为614 GB/s,MacBook Pro与Mac Studio均一致。持续推理下的散热节流风险是便携性的代价,而非带宽的代价。
- CPU: 18核M5 Max(6个性能核心+12个能效核心)
- GPU: 32核或40核M5 Max GPU
- 内存: 64GB或128GB统一内存
- 显示屏: 16.2英寸Liquid Retina XDR,3456×2234
- 内存带宽: 460 GB/s(64GB)或614 GB/s(128GB)
- 存储: 512GB-8TB SSD
- 电池: 72.4Wh锂聚合物电池(视频播放最长20小时,推理负载下更短)
- 重量: 2.14 kg
- 接口: 3×Thunderbolt 4、HDMI 2.1、SD卡插槽、耳机插孔
- 价格: ¥18,000(64GB,32核GPU)至¥23,200(128GB,40核GPU)
🏆 我们的推荐:本地LLM该买哪款Mac
基于使用场景给出明确推荐,帮你快速做出选择。
- 💰 最便宜的M5 Pro:Mac mini M5 Pro($1,699,2026年9月22日发售) • 理由:首款配备M5 Pro芯片的Mac mini。价格低于此前任何获得M5 Pro的方式。24GB基础版可处理7B-13B;配置到64GB可处理30B。 • 适合:预算有限、初次购买Apple Silicon的用户。
- 🥇 70B最佳性价比:Mac Studio M5 Max 64GB($3,499,2026年9月22日发售) • 理由:轻松运行Llama 3.3 70B Q4。与MacBook Pro相同的614 GB/s级芯片,桌面级散热无需散热节流。 • 适合:不需要便携性、需要稳定70B工作流的开发者。
- 🔥 最强性能:Mac Studio M5 Ultra 96GB($5,499,2026年9月22日发售) • 理由:全新顶级档位。最高1.2 TB/s带宽——几乎是M5 Max的两倍。512GB配置于2026年10月下旬发售。 • 状态:全新芯片——尚无独立基准测试。
- **💼 最佳便携之选:MacBook Pro 16英寸 M5 Max 64GB($3,499)[现已上市]** • 理由:与Mac Studio M5 Max 64GB相同的GPU和带宽。配备Liquid Retina XDR显示屏,便于携带。需接受持续推理下因散热节流导致的10-15%性能损失——带宽本身并不低。 • 替代方案:若不需要便携性,Mac Studio M5 Max 64GB($3,499,2026年9月22日发售)价格相近,持续工作散热更佳。
本地LLM性能基准测试(MacBook Pro M5 Pro/M5 Max,已验证)
以下数据反映了MacBook Pro 16" M5 Pro和M5 Max(2026年3月起在售)的测试结果与厂商公布的性能数据。Mac mini M5 Pro、Mac Studio M5 Max和Mac Studio M5 Ultra均于2026年9月22日发售(M5 Ultra 512GB为2026年10月下旬),目前尚无独立第三方基准测试。 由于M5 Pro和M5 Max在各机型间为完全相同的芯片,下方数据可作为合理参考,但并非这些机型的实测数据;M5 Ultra相关数据完全未经验证,因为该芯片从未发售过。所有测试均为:批大小1,上下文2048 tokens,最新模型量化。
- ## Llama 3.1 8B(Q4_K_M) • M5 Pro 32GB:25-30 tokens/秒 • M5 Pro 64GB:35-45 tokens/秒 • M5 Max 64GB:50-65 tokens/秒 • M5 Max 128GB:60-75 tokens/秒 • 参考(RTX 4090):90-120 tokens/秒
- ## Llama 3.3 70B(Q4_K_M) • M5 Pro 32GB:内存不足 • M5 Pro 64GB:4-6 tokens/秒 • M5 Max 64GB:8-12 tokens/秒 • M5 Max 128GB:12-18 tokens/秒 • 参考(RTX 4090):6-10 tokens/秒(需卸载)
- ## Llama 3.3 70B(Q5_K_M) • M5 Pro 64GB:内存不足 • M5 Max 64GB:内存不足 • M5 Max 128GB:8-12 tokens/秒 • 参考(RTX 4090):无法运行(显存限制)
- ## Llama 3.3 70B(Q8_0) • M5 Max 128GB:8-12 tokens/秒 • RTX 4090:无法运行(需要多GPU卸载)
- ## Qwen 3 32B(Q4_K_M) • M5 Pro 64GB:15-22 tokens/秒 • M5 Max 64GB:20-28 tokens/秒 • M5 Max 128GB:22-30 tokens/秒
- ## Mistral Small 24B(Q4_K_M) • M5 Pro 64GB:20-28 tokens/秒 • M5 Max 64GB:25-35 tokens/秒 • M5 Max 128GB:28-38 tokens/秒
- ## 测试方法 所有基准测试均通过搭载MLX后端的Ollama进行(2026年5月起为默认后端)。测试测量Apple Silicon M5系列上的提示词处理+token生成。MacBook Pro在持续负载3小时以上后会出现散热节流。Mac Studio在24小时以上的运行中仍能保持稳定性能。数值会因温度、后台进程及具体模型量化版本浮动10-15%。
Apple Silicon M5对比PC工作站:本地LLM
Apple Silicon和NVIDIA代表着不同的理念。以下是一个诚实的对比。
- ## Mac Studio M5 Max 128GB的优势: • 统一内存:任何模型均可使用128GB,无显存上限 • 能效:100W对比同等PC的600W以上 • 静音运行:满载下仅40分贝 • macOS生态:MLX、Metal、Core ML深度集成 • 总体拥有成本:3年内电费更低 • 高级做工:无风扇噪音,散热出色
- ## PC工作站(RTX 5090)的优势: • 7B-13B模型的原始速度:90-120 tokens/秒(M5 Max为60-75) • CUDA生态广度:更多模型、工具和研究代码 • 微调:PyTorch + CUDA的地位远超MLX • 升级灵活性:可更换GPU、增加显存 • 低端价位优势:入门级RTX 4070 Ti(800-1,200美元)已能胜过M5 Pro • 非LLM AI任务:Stable Diffusion、训练、多模态在NVIDIA上更快
- ## 诚实的结论 对于30B-70B模型的纯本地LLM推理,Mac Studio M5 Max 128GB($5,099)可直接对标4,500美元以上的PC配置,而Mac Studio M5 Ultra将上限提升到需要256GB或512GB的模型。统一内存的优势是真实且可衡量的。 对于7B-13B推理,搭载RTX 4070 Ti的1,500美元PC在原始速度上就能胜过Mac mini M5 Pro。模型越小,Apple的优势就越弱。 对于大规模微调、训练、Stable Diffusion或生产级PyTorch工作,PC + NVIDIA仍然胜出。MLX在不断进步,但差距依然存在。

Apple Silicon上MLX对比Ollama对比llama.cpp
M5上有三种主要的推理引擎可供使用。哪一款适合你?
- ## MLX(Apple原生) • 性能:M5上tokens/秒最快。原生Metal优化。 • 模型支持:持续扩展中(Llama、Qwen、Mistral、Gemma均已支持) • 配置:以Python为主,需要熟悉命令行 • 最适合:追求最大性能的高级用户 • 权衡:易用性不如Ollama
- ## Ollama(跨平台,2026年5月版+MLX后端) • 性能:在Apple Silicon上自动使用MLX(仅比纯MLX慢5-10%) • 模型支持:模型库最大,每周新增模型 • 配置:一条命令即可安装,开箱即用 • 最适合:初学者及大多数开发者。提供REST API便于集成。 • 权衡:相比纯MLX有5-10%的性能损耗
- ## llama.cpp(跨平台,最底层的控制) • 性能:经过优化后可与Ollama/MLX竞争 • 定制性:对量化和推理参数的控制最为精细 • 配置:需要编译和命令行经验 • 最适合:研究人员、自定义量化工作流 • 权衡:学习曲线比Ollama更陡
- ## 按用户类型推荐 • 初学者:Ollama(立即可用,文档丰富) • 开发者:Ollama REST API(易于集成到应用中) • 高级用户:直接使用MLX(性能最大化) • 研究人员:llama.cpp(定制性最强)
macOS快速上手指南(10个步骤)
在Apple Silicon上运行第一个70B本地LLM的最快路径。
- 1购买你的Mac
Why it matters: 根据便携需求选择Mac Studio M5 Max或MacBook Pro 16英寸M5 Max。 - 2初始macOS设置
Why it matters: 使用迁移助理(从旧Mac迁移)或全新安装。推荐macOS Sonoma 15.2以上版本。 - 3安装Homebrew
Why it matters: /bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)" —— 用于安装其他一切工具的包管理器。 - 4安装Ollama
Why it matters: brew install ollama —— 简单的一条命令即可安装。 - 5启动Ollama服务
Why it matters: ollama serve(前台运行)或使用应用程序文件夹中的Ollama.app。 - 6拉取第一个测试模型
Why it matters: ollama pull llama3.1:8b —— 用小模型验证安装是否成功(下载约4GB)。 - 7测试基本推理
Why it matters: ollama run llama3.1:8b "用一句话解释本地LLM" —— 应在15-30秒内响应。 - 8拉取目标大模型
Why it matters: ollama pull llama3.1:70b-instruct-q4_K_M(下载约35GB)。在高速网络下也需要20-40分钟。 - 9监控性能
Why it matters: asitop可显示Apple Silicon资源使用情况。在第二个终端中打开:brew install asitop && asitop。 - 10可选:安装LM Studio获取图形界面
Why it matters: 从lmstudio.ai下载。对非开发者来说比命令行更简单。完全支持M5 MLX加速。
如何在Apple Silicon M5上加速Ollama
Apple Silicon上的大多数Ollama安装默认已经使用了快速路径,所以下面这份清单是关于去除那些悄悄拖慢速度的因素,而不是什么特殊调优。
📍 简单一句话
用`ollama ps`确认Ollama是否在使用MLX/Metal后端,若不需要完整精度就降低上下文长度和量化等级,关闭占用大量内存的后台应用,长时间使用时让MacBook Pro接通电源并垫高散热。
💬 简单来说
在M5芯片的Mac上,Ollama默认情况下通常已经很快——大多数速度问题是别的东西占用了你的统一内存,或者笔记本过热,而不是漏掉了某个设置。
- 确认模型确实运行在Metal/MLX上,而不是回退到CPU。 加载模型后运行`ollama ps`——应显示模型完全在GPU上。自2026年5月起,Ollama在Apple Silicon上会自动使用MLX后端;部分回退到CPU通常意味着模型放不进你空闲的统一内存,而不是缺少某个设置。
- 在长会话前释放统一内存。 统一内存由macOS和模型共享——开着很多标签页的浏览器、Docker Desktop或后台运行的Xcode都可能占用几GB本可供Ollama加载到GPU的内存。加载大模型前关闭它们,并用活动监视器或`asitop`检查可用内存。
- 如果不需要就缩小上下文窗口。 Ollama默认的`num_ctx`会为完整上下文长度预留内存和算力,无论是否用到。对于简短对话,在Modelfile或API请求中设置更小的`num_ctx`(例如4096而非32K)——这能降低KV缓存的内存压力并加快生成速度。
- 根据实际质量需求选择量化等级。 Q4_K_M比Q8_0或Q5_K_M明显更快,质量损失通常较小且可接受(见量化指南)。如果某个模型比上面的基准测试更慢,先试试Q4版本,再假设瓶颈在硬件上。
- 长时间推理时让MacBook Pro接通电源并垫高。 如上面的基准测试所述,MacBook Pro在连续负载2-3小时后会因较薄机身内的热量积累而损失10-15%的性能。改善通风的支架,以及使用交流电而非电池供电,可以延缓这一过程。对于长达数小时的会话,Mac Studio的散热能维持MacBook Pro无法维持的完整性能。
- 更新macOS和Ollama。 苹果会在小版本更新中带来Metal性能改进,Ollama也会定期发布更快的MLX/llama.cpp后端版本。在新款M5芯片上运行旧版本的macOS或Ollama,可能会白白损失实际性能,唯一原因就是没有更新。
- 没有必要就不要同时运行多个模型。 每个加载的模型都会占用自己那份统一内存。`OLLAMA_MAX_LOADED_MODELS`控制Ollama同时保留多少个常驻模型——默认值允许多于一个,这很方便,但如果你同时查询多个模型,会把可用的内存带宽分摊给这些模型。
# 检查模型是否完全卸载到GPU
ollama ps
# 使用更小的上下文窗口运行(更快,内存压力更小)
ollama run llama3.1:8b --verbose
# 或在Modelfile中设置:PARAMETER num_ctx 4096
# 限制Ollama同时只保留一个常驻模型
OLLAMA_MAX_LOADED_MODELS=1 ollama serve决策矩阵:该购买哪种Mac配置
使用此矩阵根据使用场景找到最适合你的选择。
- 1. 预算优先,小型模型(7-13B):Mac mini M5 Pro 24GB($1,699)——最便宜的M5 Pro
- 2. 经济型桌面运行30B模型:Mac mini M5 Pro 64GB($2,699)
- 3. 希望轻松运行70B模型:Mac Studio M5 Max 64GB($3,499)
- 4. 需要在32K以上上下文窗口下运行70B Q5:Mac Studio M5 Max 128GB($5,099)
- 5. 需要256-512GB以运行最大规模本地模型:Mac Studio M5 Ultra($5,499-10,000+)
- 6. 便携本地LLM,愿意接受散热节流:MacBook Pro 16英寸M5 Max 64GB($3,499)
- 7. 已经在使用macOS生态(Xcode、Final Cut Pro):任意M5 Mac Studio型号
- 8. 涉及MLX实验的研究/微调:Mac Studio M5 Max 128GB或M5 Ultra
- 9. 追求最大静音和空闲运行:Mac Studio(风扇很少转动)
- 10. 预算$4,000以上,想要便携:MacBook Pro 16英寸M5 Max 128GB($4,499)
- 11. 考虑其他替代方案:PC RTX 4090(3,000美元以上)或AMD Ryzen AI Max+迷你PC(1,600-2,000美元)
Apple Silicon M5不适合本地LLM的情况
Apple Silicon很优秀,但并非万能。以下场景应避免选择Mac。
- 你需要CUDA专属工作流: 大多数LLM推理都能在Apple Silicon上运行,但使用torch.cuda的微调、vLLM的CUDA内核以及专有CUDA研究代码都无法在MLX上运行。如果你70%的工作都是CUDA专属,请选择RTX GPU。
- 你有大量Stable Diffusion工作: 扩散模型在M5上比RTX 4090慢2-3倍。如果图像生成占工作流的30%以上,PC + RTX更胜一筹。
- 预算是绝对优先事项: 搭载RTX 4070 Ti的1,500美元PC在7B-13B推理速度上就能胜过Mac mini M5 Pro。如果只关心预算,PC更便宜。
- 你需要工作站的可升级性: Mac Studio的内存和存储在购买时就已固定。PC则允许逐步升级。若打算使用5年以上,PC长期来看可能更划算。
- 你追求三位数的tokens/秒: RTX 4090在Llama 8B上可达90-120 tokens/秒。M5 Max为60-75。对于高吞吐量推理(服务多个用户),NVIDIA仍占优势。
- 你还没有使用macOS: 除非你还有其他理由需要macOS,否则仅为了本地LLM从Windows/Linux切换生态系统并不值得。
- 你需要24/7的生产环境推理: Mac Studio很出色,但更适合突发式使用。对于需要持续推理SLA的场景,企业级NVIDIA工作站是更安全的选择。
常见问题
如何让Ollama在MacBook Pro M5上运行更快?
用`ollama ps`确认模型运行在Metal/MLX上,关闭占用大量内存的后台应用以释放统一内存,如果不需要长上下文窗口就降低`num_ctx`,使用Q4_K_M量化而非Q5/Q8,并在超过2-3小时的会话中让MacBook Pro接通电源并垫高散热,以延缓因发热导致的性能下降。完整清单见上方的速度优化部分。
Mac Studio M5 Max能运行Llama 3.3 70B吗?
可以,所有M5 Max配置都能运行。64GB以8-12 tokens/秒运行70B Q4。128GB以8-12 tokens/秒运行70B Q5(质量更高,速度相同)。
本地LLM方面M5 Max与RTX 4090相比如何?
M5 Max在小模型上较慢(Llama 8B为60-75对比90-120 tokens/秒)。在大模型上具有竞争力(Llama 70B为8-12对比6-10 tokens/秒)。M5 Max功耗仅为其三分之一。
64GB内存够用吗,还是需要128GB?
若只运行单个70B Q4模型,64GB已足够。若需要70B Q5、多模型并发或微调,建议选择128GB。
M5 Pro和M5 Max在LLM方面有什么区别?
M5 Pro配备16/20核GPU,带宽307 GB/s,最高64GB。M5 Max配备32/40核GPU,带宽460/614 GB/s,最高128GB。在同一内存档位下,M5 Max快30-50%。M5 Ultra(仅Mac Studio提供)更进一步:最高80核,最高1.2 TB/s,最高512GB。
Mac mini现在配备M5 Pro了吗?
是的,已于2026年8月25日确认。Mac mini M5 Pro起售价$1,699(24GB,最高64GB),307 GB/s,Thunderbolt 5。2026年9月22日发售——史上最便宜的M5 Pro Mac。
Mac Studio还提供M5 Pro配置吗?
不再提供。自2026年8月25日更新起,Mac Studio从M5 Max起步($2,499)。Mac mini现在是获得M5 Pro芯片的入门选择。
什么是Mac Studio M5 Ultra,支持多少内存?
M5 Ultra是位于M5 Max之上的全新芯片,仅Mac Studio提供,起售价$5,499(96GB)。现可扩展至256GB,2026年10月下旬将提供512GB(价格预计远超10,000美元),带宽最高1.2 TB/s。
MacBook Pro在持续LLM推理下会散热节流吗?
会,连续推理2-3小时后,MacBook Pro性能会下降10-15%。Mac Studio可全天候维持满载性能。
能在Apple Silicon上运行Stable Diffusion吗?
可以,Stable Diffusion XL在M5上每张图需8-12秒(比RTX 4070的约3秒慢)。MLX原生支持。
在Mac上MLX比Ollama快吗?
MLX在原始token吞吐量上快5-10%。Ollama更便捷,性能损失很小。应根据工作流而非原始速度差异来选择。
Mac Studio M5用于LLM推理耗电多少?
Mac Studio M5 Max:持续70-100W。全天候推理一个月(720小时)约耗电60kWh,美国电费约8-12美元。同期RTX 4090配置需40-60美元。
能在Apple Silicon上微调模型吗?
可以,LoRA微调效果良好。全权重微调比桌面GPU慢(目前尚不支持分布式训练)。
Apple Silicon是否推理强但训练弱?
部分正确。推理表现出色。训练/微调可行但比NVIDIA慢。MLX框架正在快速改进。
神经网络引擎对LLM有何帮助?
神经网络引擎(8 TOPS,16核)可加速量化运算(INT8、Q4)。对Q4_K_M模型有可测量的收益(约10%)。
能在M5 Max 128GB上同时运行多个模型吗?
可以。128GB可支持同时运行两个32B模型,或一个70B加一个13B,且速度尚可。
在Mac上配置本地LLM通常需要多长时间?
从全新Mac到通过Ollama运行第一个70B模型,通常需要15-30分钟(包括在高速网络下20-40分钟的模型下载时间)。
Apple Silicon是否支持所有最新模型(Llama 4、Qwen 3等)?
截至2026年8月:Llama 3.3 ✓、Qwen 3 ✓、Mistral ✓、Gemma ✓、DeepSeek ✓。MLX支持范围每周都在扩展。请查看MLX的GitHub获取最新列表。
本地LLM应该买Mac mini M6还是Mac mini M5 Pro?
M6是入门款($899,最高32GB,170 GB/s),超出小型模型范围就不适合本地LLM。M5 Pro($1,699,最高64GB,307 GB/s)才是本地LLM的正确选择。
翻新的Mac Studio值得考虑吗?
值得。Apple翻新产品享有1年保修,并能保持原价的90-95%。可节省10-15%的花费。
