关键要点
- 总构建成本:约$1,010。 RTX 5060 Ti 16GB($430)、Ryzen 5 7600($180)、32GB DDR5-6000($90)、1TB Gen4 NVMe($70)、B650 mATX主板($130)、650W 80+金牌电源($75)、mATX机箱($65)。
- 16GB显存才是目标,而非GPU原始速度。 在LLM任务中,RTX 5060 Ti 16GB胜过显存为8-12GB但速度更快的显卡,因为决定能否运行模型的是模型大小,而非着色器数量。
- 7B模型:Q4下55-65 tok/s。 14B模型:28-35 tok/s。32B模型在Q4下可以装下,为上下文留有1-2GB余量,运行速度为12-15 tok/s。
- 70B模型无法装下。 70B模型在Q4下需要约40GB显存;本构建的上限约为32B。70B级别推理请参见$2,000双GPU构建方案。
- 系统内存需要32GB,而非16GB。 模型加载、操作系统开销以及任何CPU卸载层都需要GPU之外的余量;16GB内存在运行14B以上模型时会引发交换。
- 避免: 8GB显存GPU(RTX 5060、RTX 4060 Ti 8GB)——它们的上限为7B,若不整体更换GPU则无法扩展到13B-14B。
这笔预算实际买到了什么
本地LLM推理速度首先受限于显存容量,其次是内存带宽,计算能力(CUDA核心数)则是远远次要的第三因素。 装不下显存的模型要么加载失败,要么溢出到系统内存,导致吞吐量下降5-10倍。在$1,000预算下,唯一正确的分配方式是让GPU占比过重、其余部分占比不足——这就是为什么本构建的CPU是一款$180的中端产品,而非$350的旗舰型号。
本构建假定为单模型推理(通过Ollama、LM Studio或llama.cpp一次加载一个模型),而非并发多用户服务。若要同时处理多个请求,显存需求会进一步上升,$1,000预算并不现实。
📍 简单一句话
$1,000本地LLM PC构建应将近一半预算花在GPU显存容量上,而非CPU速度,因为显存决定了哪些模型能够运行。
💬 简单来说
显存(VRAM)= GPU自身用于存放模型的内存;如果模型装不下,一切都会变慢5-10倍,或者直接加载失败。
完整配件清单
价格为截至2026年7月的市场价,因地区和零售商而异。
| 配件 | 选择 | 价格 | 原因 |
|---|---|---|---|
| GPU | RTX 5060 Ti 16GB | $430 | 16GB显存是本构建的核心目的——可轻松容纳14B,Q4下可容纳32B |
| CPU | AMD Ryzen 5 7600 | $180 | 6核心足以应对单模型推理;CPU不是瓶颈 |
| 内存 | 32GB DDR5-6000(2x16GB) | $90 | 为操作系统、模型加载及任何CPU卸载层预留余量 |
| 存储 | 1TB NVMe Gen4 SSD | $70 | 模型加载速度快;5个模型的库在Q4下占用约40-60GB |
| 主板 | B650 mATX | $130 | PCIe 4.0 x16插槽,支持DDR5,没有多余功能 |
| 电源 | 650W 80+金牌 | $75 | RTX 5060 Ti功耗为180W;650W为瞬时峰值留有余量 |
| 机箱 | mATX中塔 | $65 | 为持续推理负载提供风道;可容纳任何长度的5060 Ti显卡 |
| CPU散热器 | 原装散热器 | $0 | Ryzen 5 7600在此工作负载下无需第三方散热器 |
为什么选择RTX 5060 Ti 16GB而非更便宜的GPU
对本地LLM任务而言,同价位GPU的8GB和12GB版本只是虚假的省钱方式。 RTX 5060 Ti有8GB和16GB两个版本,价差约$100——对LLM推理而言,只有16GB版本值得购买,因为8GB版本在Q4下无法舒适地运行超过7B的模型,且几乎没有可用的上下文长度。
显存余量对上下文长度同样重要:一个7B模型本身在Q4下需要约4-4.5GB,而16K token的上下文会额外增加1-2GB的KV缓存。在8GB显卡上几乎没有余量;而在16GB显卡上,模型和长上下文窗口都能容纳。
- RTX 5060 Ti 8GB($330): 仅能在Q4下勉强容纳7B——长上下文窗口会导致显存溢出。不推荐。
- RTX 4060 Ti 16GB(上一代,二手约$450): 显存与5060 Ti相同,价格相近或更高,但算力更低——没有理由优先选择这款新卡。
- RTX 5060 Ti 16GB($430,本构建选择): 截至2026年7月,16GB级别中每美元显存性价比最高。
- 二手RTX 3090 24GB(约$650-750): 显存更大(可更舒适地运行30B左右的模型),但会使总构建成本超过$1,300,且功耗明显更高。
各模型规模的预期性能
所有数据均为Q4_K_M量化,在RTX 5060 Ti 16GB上使用llama.cpp/Ollama测得。实际速度会因提示词长度、量化方法和推理引擎而异。
| 模型规模 | Q4显存占用 | 每秒Token数 | 是否舒适运行? |
|---|---|---|---|
| 7B-8B | ~4.5-5GB | 55-65 | 是——上下文余量充足 |
| 13B-14B | ~8-9GB | 28-35 | 是——上下文余量超过8GB |
| 20B(MoE,约4B激活) | ~12GB | 35-45 | 是 |
| 32B | ~14.5-15.5GB | 12-15 | 紧张——仅支持短上下文(4K-8K) |
| 70B | ~40GB | 不适用 | 无法运行——参见$2,000双GPU构建方案 |
组装注意事项
- GPU空间: 下单前请确认RTX 5060 Ti显卡长度(不同厂商210-270mm不等)是否符合mATX机箱的最大GPU容纳尺寸。
- BIOS中的内存速度: DDR5-6000套装出厂时通常默认以JEDEC 4800运行——在BIOS中启用EXPO/XMP才能达到标称的6000速度,这会影响任何层卸载时CPU端的Token生成速度。
- 驱动安装顺序: 应先安装最新的NVIDIA驱动和CUDA工具包,再安装Ollama或LM Studio,而非相反——两者都会在安装时自动检测GPU能力。
- 电源线材: RTX 5060 Ti使用单个8针(部分型号为12VHPWR)PCIe供电接口——组装前请确认电源的模组化线材套装包含正确的接口。
升级路径
本构建的设计理念是,日后唯一值得更换的部件就是GPU。B650主板支持第二个PCIe插槽(通常为x4电气规格),可用于后续加装第二张GPU,不过tensor-split多GPU推理至少需要x8/x8才能避免PCIe带宽瓶颈——为此专门选择主板的方案请参见$2,000构建方案。
从本构建升级的一条直接路径是,在预算允许时将RTX 5060 Ti 16GB更换为二手RTX 3090 24GB,这样可以舒适运行32B推理,并支持轻度的70B卸载。Ryzen 5 7600、32GB内存和650W电源都留有足够余量,无需其他改动即可支持这次更换。
该预算下的常见错误
- 为省$100购买8GB版RTX 5060 Ti——由此造成的显存上限无法通过软件解决,日后被迫更换GPU,总成本反而更高。
- 在使用8GB或12GB显存GPU的同时,在CPU上超支(例如选择Ryzen 7而非Ryzen 5)——一旦模型能装入显存,CPU的选择对每秒Token数几乎没有影响。
- 跳过BIOS中的EXPO/XMP内存配置文件设置,导致DDR5-6000套装以4800运行——这是白白损失的性能,修复却不花一分钱。
- 为省$20-30而选用功率不足的电源——GPU在持续负载下功耗会短暂大幅超过额定TDP,550W电源留有的余量太少。
常见问题
$1,000的PC能很好地运行本地LLM吗?
可以,7B-14B模型能舒适运行,32B模型可在紧凑的Q4量化下运行。RTX 5060 Ti 16GB是本构建的核心部件,也是决定性因素——显存容量远比GPU之外的预算更重要。
为什么本构建在GPU上的花费相对CPU高出这么多?
本地LLM推理速度几乎完全取决于GPU显存容量和内存带宽。一旦模型加载进显存,更快的CPU并不会提升每秒Token数,因此对于这一特定工作负载,中端CPU搭配强劲GPU胜过强劲CPU搭配弱势GPU。
2026年本地LLM需要16GB显存够用吗?
16GB可以在Q4下舒适容纳所有7B-14B模型并留有长上下文空间,也能在Q4下以较短上下文窗口容纳32B模型。但无法容纳70B级别的模型,这类模型在Q4下需要约40GB。
我可以改用8GB显存GPU来省钱吗?
可以,但这会将你限制在7B模型且上下文余量极小——这是一个不更换显卡就无法突破的硬性上限。8GB版RTX 5060 Ti省下的$100,不值得以失去13B-14B模型的使用能力为代价。
搭配16GB显存GPU实际需要多少系统内存?
32GB系统内存。这足以覆盖操作系统开销、加载时的模型文件缓存,以及为略微超出显存容量的模型卸载到CPU的任何层。
本构建能良好运行32B模型吗?
在Q4量化下可以容纳32B模型,速度约为12-15 tokens/秒,但由于加载模型后剩余显存余量很少,上下文长度被限制在约4K-8K token。
在本构建上应该运行什么软件?
Ollama或LM Studio是最简单的入门选择——两者都能自动检测RTX 5060 Ti并自动处理Q4量化。直接使用llama.cpp则能更精细地控制量化格式和上下文设置。
本构建以后能升级到运行70B模型吗?
单张GPU无法做到——70B在Q4下需要约40GB显存。最直接的升级路径是更换为二手RTX 3090 24GB(对完整70B仍略显不足),或加装第二张GPU进行显存池化,这正是$2,000双GPU构建方案所覆盖的内容。
主板芯片组(B650对比B850)对本地LLM推理有影响吗?
对单GPU构建没有影响。B650提供了GPU所需的PCIe 4.0 x16插槽;B650与更新主板之间的芯片组差异,对多GPU的PCIe通道分配影响更大,对单GPU LLM推理的影响较小。
在这一预算下,二手GPU比全新RTX 5060 Ti 16GB更划算吗?
二手RTX 3060 12GB价格可能更低,但显存更少、内存带宽更低,能运行的模型规模也更少。二手RTX 3090 24GB在显存上是真正的升级,但加上构建其余部分后总成本会超过$1,300——它属于更高的预算档位,而非本构建。