关键要点
- 总构建成本:约$1,940。 两张RTX 5060 Ti 16GB(合计$860)、Ryzen 7 9700X($330)、64GB DDR5-6000($180)、2TB Gen4 NVMe($130)、支持x8/x8插槽的B650 ATX主板($180)、850W 80+金牌电源($130)、ATX机箱($90)。
- 在每美元显存性价比上,两张16GB显卡胜过一张24GB显卡。 约$860获得合计32GB显存,胜过二手RTX 3090 24GB(约$700-750,总显存更少),成本也远低于单张32GB工作站显卡。
- 70B模型可以运行,速度为12-18 tok/s,通过llama.cpp在两张卡之间进行tensor-split——这正是本构建使用两张GPU而非一张更大GPU的全部原因。
- 主板必须支持x8/x8 PCIe通道拆分,而不仅仅是两个物理x16插槽。若第二个插槽以x4电气规格运行,会为tensor-split推理带来实实在在的带宽瓶颈。
- 单GPU回退方案依然表现良好:对于较小的模型,仅使用一张RTX 5060 Ti运行32B可达25-30 tok/s——比拆分一个本就能装入单卡的模型更快。
- 避免: 显卡型号不匹配的组合(例如一张5060 Ti + 一张4060 Ti)——tensor-split性能会受限于较慢的那张卡,且不同代际显卡之间的驱动不匹配会导致不稳定。
为什么选择两张GPU而非一张更大的GPU
在$2,000预算下,单GPU构建的上限约为二手RTX 3090 24GB或RTX 5070 Ti 16GB——两者都达不到70B级模型的容量要求。 llama.cpp和vLLM都支持tensor-split推理,可将模型的各层拆分到同一主板上的多张GPU,将其显存合并为一个池。两张RTX 5060 Ti 16GB显卡以低于单张24GB显卡的价格,提供合计32GB显存,并舒适地超过70B模型在Q4下的需求(系统+显存总预算约40GB,模型本身在两张卡上合计约需38-40GB显存)。
这之所以可行,是因为两张卡是相同型号——若卡之间显存或算力不匹配,拆分会受限于较弱的那张卡,而不同代际显卡之间不匹配的驱动要求还可能直接导致系统不稳定。
📍 简单一句话
在相同的$2,000预算下,通过tensor-split推理池化的两张同型16GB显卡,比一张更大的单卡提供更多每美元可用显存。
💬 简单来说
Tensor-split = 一种将模型各层分摊到两张GPU上的软件技术,使它们的显存相加,就像显存的RAID。
完整配件清单
价格为截至2026年7月的市场价,因地区和零售商而异。
| 配件 | 选择 | 价格 | 原因 |
|---|---|---|---|
| GPU(x2) | 2x RTX 5060 Ti 16GB | $860 | 通过tensor-split合计32GB显存——本构建的核心目的 |
| CPU | AMD Ryzen 7 9700X | $330 | 8核心可应对两张GPU的PCIe/驱动开销以及任何CPU卸载层 |
| 内存 | 64GB DDR5-6000(2x32GB) | $180 | 更大的模型和双GPU驱动开销需要比单GPU构建更多的余量 |
| 存储 | 2TB NVMe Gen4 SSD | $130 | 仅70B模型在Q4下就占用约40GB;多模型库需要额外空间 |
| 主板 | 支持x8/x8 PCIe的B650 ATX | $180 | PCIe通道必须以x8/x8而非x16/x4拆分,以避免tensor-split带宽瓶颈 |
| 电源 | 850W 80+金牌 | $130 | 两张RTX 5060 Ti合计功耗约360W;850W为瞬时峰值留有余量 |
| 机箱 | ATX中塔(双GPU间距) | $90 | 两张双槽GPU之间需要间距以保证足够的风道 |
| CPU散热器 | 中端风冷散热器 | $40 | Ryzen 7 9700X在持续双GPU推理负载下,使用优于原装的散热器会有更好表现 |
大多数攒机者忽略的主板要求
两个物理PCIe x16插槽并不代表两个x16电气连接。 许多消费级主板将第二个插槽的电气规格设为x4,尽管物理尺寸是x16。对于tensor-split LLM推理而言,两张GPU在每次前向传播中都会主动传输数据——x4的第二插槽会成为实实在在的瓶颈,而非理论上的瓶颈。
购买主板前,请查看其规格表中的"PCIe通道分配"或"x8/x8模式"——支持该功能的主板通常会明确列出,因为这需要芯片组具备足够的原生PCIe通道以均分。本构建假定使用一款明确标注支持x8/x8的B650 ATX主板。
- 确认是x8/x8而非x16/x4: 查看主板说明书中的PCIe通道图,而不仅仅是物理插槽数量。
- 插槽间距在物理上同样重要: 两张双槽GPU之间至少需要一个空插槽的间距以保证风道——请核实主板布局中的插槽间距,而不只是通道分配。
- 对该工作负载而言,PCIe代数不如通道数量重要——PCIe 4.0 x8已经超过tensor-split传输实际所需的带宽;为了PCIe 5.0插槽多花溢价并不值得。
各模型规模的预期性能
所有数据均为Q4_K_M量化,在两张RTX 5060 Ti 16GB显卡上使用llama.cpp tensor-split测得。单GPU数据仅使用一张显卡。
| 模型规模 | 配置 | Q4显存占用 | 每秒Token数 |
|---|---|---|---|
| 7B-14B | 单GPU(无需拆分) | ~4.5-9GB | 55-65(7B)/ 28-35(14B) |
| 32B | 单GPU | ~14.5-15.5GB | 25-30(相比$1,000构建有充足的上下文余量) |
| 32B | Tensor-split(两张GPU) | ~15GB分摊 | 30-38(即使单卡就能装下,拆分仍有帮助) |
| 70B | Tensor-split(两张GPU,必需) | ~38-40GB分摊 | 12-18 |
配置Tensor-Split推理
一旦两张GPU都被驱动识别,llama.cpp只需一个命令行参数即可处理tensor-split。 确认两张RTX 5060 Ti都出现在`nvidia-smi`中后,使用`--tensor-split 1,1`启动模型即可在两卡间均分各层,若其中一张卡还要驱动显示器、需要为模型少预留一些显存,可调整比例(例如`--tensor-split 1,1.2`)。
Ollama较新版本已自动支持多GPU——它会检测所有已安装GPU的可用显存,并在无需手动配置的情况下拆分大模型,不过llama.cpp的手动参数能对拆分比例进行更精细的控制。
- 确认两张GPU均被检测到: 尝试拆分前,`nvidia-smi`应列出两张卡且驱动版本一致。
- 从均分开始: 对于两张相同的显卡,llama.cpp中的`--tensor-split 1,1`是正确的默认设置。
- 留意PCIe带宽饱和: 如果每秒Token数远低于预期范围,请确认主板确实以x8/x8运行,而非悄悄回退到x4。
升级路径
从本构建升级最直接的方式是,若主板有第三个具备可用带宽的PCIe插槽,加装第三张RTX 5060 Ti 16GB,将合计显存提升到48GB——足以支持更大量化精度的70B模型,或为更长的上下文窗口提供充裕余量。
另一种更昂贵但更简单的升级方式是,日后将两张RTX 5060 Ti显卡替换为两张RTX 5070 Ti 16GB,保持相同的32GB显存上限,但提升原始算力和内存带宽,从而在不改变可运行模型规模的前提下提高每秒Token数。
该预算下的常见错误
- 仅凭"支持SLI/CrossFire"的宣传标语选购主板——这一营销术语指的是游戏多GPU渲染,而非计算工作负载的PCIe通道分配,并不能保证x8/x8。
- 为省钱混用不同代际的GPU(例如一张RTX 5060 Ti + 一张RTX 4060 Ti)——tensor-split性能会受限于较慢/较旧的那张卡,抹去了新卡带来的大部分优势。
- 低估电源余量——在长时间生成过程中,两张GPU同时接近其合计额定TDP时,功耗可能短暂大幅超过360W;电源功率不足会在负载下导致随机关机,而非平稳降速。
- 误以为GPU数量翻倍就等于每秒Token数翻倍——tensor-split会在各层之间增加PCIe传输开销,因此对于本就能装入单张GPU的模型,合计吞吐量会明显低于单卡速度的2倍。
常见问题
$2,000的PC能运行70B本地LLM吗?
可以,使用两张RTX 5060 Ti 16GB显卡进行tensor-split配置,池化出合计32GB显存——足以在Q4量化下运行70B模型,速度为每秒12-18个token。
为什么使用两张16GB显卡,而不是一张24GB或32GB显卡?
在相同预算下,两张同型16GB显卡提供的每美元合计显存高于单张更大的显卡,且llama.cpp的tensor-split功能可让两张卡的显存作为一个整体池用于推理。
主板对双GPU本地LLM构建重要吗?
是的,非常重要。主板必须在两个GPU插槽间支持x8/x8的PCIe通道分配——若第二插槽以x4电气规格运行,在tensor-split推理期间会形成实实在在的带宽瓶颈,而非理论上的瓶颈。
双GPU构建中可以混用不同型号的显卡吗?
不建议。Tensor-split性能会受限于两张卡中较慢或较旧的那张,且不同代际显卡之间不匹配的驱动要求可能导致不稳定。请使用两张完全相同的显卡。
对于tensor-split多GPU推理,Ollama还是llama.cpp更好?
Ollama能自动检测多张GPU且无需手动配置,对大多数用户而言更简单。llama.cpp的手动--tensor-split参数能对拆分比例进行更精细的控制,适合其中一张GPU还需驱动显示器、需要预留较少显存的情况。
PCIe带宽究竟对tensor-split性能有多大影响?
如果插槽以x4而非x8运行,影响会很显著。PCIe 4.0 x8提供的带宽已超过tensor-split推理通常所需,但x4会成为实实在在的瓶颈,因为两张GPU在每次前向传播中都会主动传输数据。
GPU数量翻倍会让每秒Token数也翻倍吗?
不会。Tensor-split会在跨卡拆分的各层之间增加PCIe传输开销,因此对于本就能装入单张GPU的模型,合计吞吐量会明显低于单卡速度的2倍。其带来的好处是能容纳更大的模型,而非线性的速度提升。
两张RTX 5060 Ti显卡的总功耗是多少?
满载时合计约360W(各自额定TDP为180W),并伴有短暂超出该值的瞬时峰值。850W 80+金牌电源在应对这些峰值的同时,仍为系统其余部分留有充裕余量。
仅使用一张GPU能让本构建更快地运行较小的模型吗?
可以——对于本就能装入16GB显存的模型(Q4下最高32B),仅使用一张RTX 5060 Ti可以完全避免tensor-split的PCIe开销,比拆分一个本不需要拆分的模型更快。
超出本构建的升级路径是什么?
加装第三张同型RTX 5060 Ti 16GB(若主板有第三个可用PCIe插槽)可将合计显存提升到48GB。另一种方式是日后将两张卡替换为RTX 5070 Ti 16GB,保持相同的32GB上限,但提升算力和内存带宽。