关键要点
- RTX 4090依然是2026年本地AI最佳单卡消费级GPU:24GB显存,约1TB/s带宽——其二手价格自春季以来甚至略有下降
- 2026年5月约1000元的64GB DDR5套装,如今约6000元——内存短缺对预算的影响超过GPU价格波动
- 70B Q4模型需要40GB以上显存——需要双RTX 3090或CPU卸载
- Ryzen 9 9950X(Zen 5,16核)实际售价已降至约3500元,5月约2900元——是唯一变便宜的组件
- PCIe Gen 4/5 NVMe可在2秒内加载完7B模型,但4TB Gen 5硬盘现在约5700元,此前约1400元
- 第一、二档共用AM5插槽——GPU/内存可后续升级无需换主板;第三档需要TRX50
应该组装哪种工作站?
根据实际需要运行的最大模型选择:7B–14B→入门档。14B–32B→推荐档。70B→专业档。以下为2026年8月25日核实的整机总价。
入门档 | 推荐档 | 专业档 | |
|---|---|---|---|
| 价格 | 约19300元 | 约38000元 | 约62600元 |
| GPU | RTX 3090 24GB(二手) | RTX 4090 24GB | 2× RTX 3090(48GB) |
| CPU | Ryzen 7 7700X | Ryzen 9 9950X | Threadripper 7960X |
| 内存 | 64GB DDR5 | 64GB DDR5-6000 | 256GB DDR5 ECC |
| 最大模型 | 32B Q4纯GPU | 30B Q4 GPU/70B卸载 | 70B Q4以GPU速度 |
| 最适合 | 预算有限,7B–14B | 大多数用户,14B–32B | 70B负载、多用户 |
以下总价都高于2026年其他地方引用的价格——这是DDR5/NAND短缺导致(见档位表格后的说明),并非错误。相比之下,GPU价格保持平稳甚至略降。
赞助内容
编辑推荐:RTX 4090推荐档工作站
2026年综合最佳本地AI工作站——在显存、升级空间和价格之间为最广泛的模型范围取得平衡。
- 24GB显存——32B Q4以内的模型均可完全在GPU上运行
- 64GB DDR5-6000——足以通过CPU卸载以10–15 tok/s运行70B
- Qwen3 32B Q4完全在GPU上以28–38 tok/s运行;70B可卸载运行
- 约38000元整机方案,2026年8月25日核实
- 可跳过的情况: 如果只运行7B–14B模型,入门档可省约18700元且效果相当
显存决定配置——将模型规模与硬件匹配
不确定需要哪个档位?从实际计划运行的最大模型出发,而非将来可能运行的模型。
模型规模 | 建议显存 | 最佳配置 |
|---|---|---|
| 7B | 8–12GB | 入门档(RTX 3090绰绰有余) |
| 14B | 16–24GB | 入门档或推荐档 |
| 32B Q4 | 约20–24GB | 推荐档(RTX 4090) |
| 70B Q4 | 约40GB以上 | 专业档(双RTX 3090)或在推荐档卸载 |
| 70B Q8 | 约70GB以上 | 仅限多GPU——参见我们的GPU指南 |
只需要单张GPU(不是整机方案)?参见GPU购买指南。
第一档:约19300元预算AI工作站
预算方案以二手RTX 3090(24GB显存)为核心。Llama 3.1 8B Q8达45–60 tok/s,Qwen3 14B Q8达20–28 tok/s,Qwen3 32B Q4达12–18 tok/s,全部纯GPU运行。适合购买的情况: 预算低于23000元、主要运行7B–32B模型、可接受二手GPU。应跳过的情况: 70B是主要负载——本档CPU卸载70B仅5–8 tok/s,可用但较慢。
- 全GPU速度支持的模型: 7B(任意量化)、13B、14B Q4/Q8、30B Q4
- 70B支持: 需要CPU卸载 — 约5–8 tok/s
- 峰值功耗: 约450W
组件 | 型号 | 价格 |
|---|---|---|
| GPU | NVIDIA RTX 3090(二手,24GB) | 约6000元 |
| CPU | AMD Ryzen 7 7700X | 约1550元 |
| 主板 | MSI MAG X670E Tomahawk WiFi | 约1350元 |
| 内存 | 64GB DDR5-5600(2×32GB) | 约6000元(5月约750元) |
| 存储 | 2TB PCIe Gen 4 NVMe | 约2500元(5月约600元) |
| 电源 | 850W 80+金牌 | 约780元 |
| 机箱 | 中塔ATX,3+风扇位 | 约570元 |
| CPU散热 | 240mm水冷或塔式风冷 | 约500元 |
| 合计 | 约19250元 |
💡提示: 二手 vs 全新:二手RTX 3090(闲鱼约5000–7500元)比所剩无几的全新库存便宜30–50%,代价是保修不确定。选择支持退货的卖家,并检查是否有挖矿磨损痕迹(风扇噪音异常等)。
第二档:约38000元推荐AI工作站
推荐方案以RTX 4090(24GB,约1TB/s内存带宽)搭配AMD Ryzen 9 9950X(Zen 5,16核)为核心。RTX 4090比RTX 3090每GB显存快30–40%,每个token能耗更低。适合购买的情况: 想要最佳单卡工作站、经常运行14B–32B模型、偶尔卸载运行70B。应跳过的情况: 70B是日常主要负载——应选专业档以GPU速度运行70B。
- 7B Q4速度: 约105–125 tok/s
- 14B Q8速度: 约48–60 tok/s
- 30B Q4速度: 约28–38 tok/s
- 70B Q4(CPU卸载): 约10–15 tok/s(64GB内存)
- 峰值功耗: 约550W
组件 | 型号 | 价格 |
|---|---|---|
| GPU | NVIDIA GeForce RTX 4090 24GB | 约15600元 |
| CPU | AMD Ryzen 9 9950X(16C/32T,Zen 5) | 约3500元(5月约2900元) |
| 主板 | ASUS ProArt X870E-Creator WiFi | 约3700元 |
| 内存 | 64GB DDR5-6000 CL30(2×32GB) | 约6400元(5月约1000元) |
| 存储 | 4TB PCIe Gen 5 NVMe | 约5700元(5月约1400元) |
| 电源 | 1000W 80+白金 | 约1300元 |
| 机箱 | 全塔ATX | 约1000元 |
| CPU散热 | 360mm水冷 | 约780元 |
| 合计 | 约37980元 |
第三档:约62600元专业70B工作站
使用双RTX 3090(合计48GB显存)实现GPU速度(25–40 tok/s)运行70B模型。Ryzen Threadripper 7960X(24核)加速大型层CPU卸载,256GB DDR5 ECC支持甚至140B量化模型完整加载到内存。适合购买的情况: 70B是主要负载、需要48GB以上GPU显存、或支持多用户并发。应跳过的情况: 从未运行过超过32B的模型——本档明显配置过剩。
- 70B Q4速度: 25–40 tok/s(双RTX 3090通过张量并行)
- 256GB内存CPU卸载: 140B以上模型4–6 tok/s运行
- 峰值功耗: 约900W
组件 | 型号 | 价格 |
|---|---|---|
| GPU ×2 | 2× NVIDIA RTX 3090 24GB(二手) | 约12000元 |
| CPU | AMD Ryzen Threadripper 7960X(24C) | 约9950元(波动大——6800–17800元均有出现) |
| 主板 | ASUS Pro WS TRX50-SAGE WiFi | 约5700元 |
| 内存 | 256GB DDR5-5200 ECC(8×32GB) | 约19900元(5月约4550元——购买前请核实) |
| 存储 | 8TB PCIe Gen 4 NVMe(2×4TB) | 约9950元(5月约2500元) |
| 电源 | 1600W白金模组 | 约2500元 |
| 机箱 | 全塔HEDT ATX | 约1550元 |
| CPU散热 | 360mm水冷+额外风扇 | 约1050元 |
| 合计 | 约62600元 |
⚠️警告: 2026年DDR5短缺对ECC/RDIMM服务器内存冲击最大——256GB DDR5 ECC套装既稀缺又价格波动剧烈。下单前请向主板QVL列表内的内存获取实时报价,上表为核实估算值,非保证价格。
不建议购买的硬件
- 目标是32B模型却选8GB显存GPU — 会立即遭遇显存瓶颈,任何CPU卸载技巧都无法像扩展内存那样弥补显存不足
- 昂贵CPU搭配显存不足的GPU — 决定推理速度的是GPU及其显存,而非CPU主频
- 新装AI工作站使用SATA SSD — 模型加载速度比PCIe Gen 4 NVMe慢5倍,差价仅150–300元
- 电源功率不足 — 专业档峰值接近900W,廉价750W电源在双GPU持续负载下会不稳定
- 认真的70B CPU卸载只配32GB内存 — 模型本身仅驻留内存就需要约40GB
应该自建工作站还是租用云GPU?
本地工作站 vs 云GPU租赁
以下情况使用本地LLM:
- •每天使用本地模型2小时以上
- •隐私或数据留存对你的业务很重要
- •希望长期成本固定、可预测
- •已经决定好上述某个档位
以下情况使用云端模型:
- •每天使用本地模型不到1小时
- •使用场景偶尔或突发(批处理、测试)
- •不想处理硬件维护
- •想在投入硬件前先试用70B+模型
快速决策:
- →每天重度使用 → 自建工作站(见上方档位表格)
- →偶尔使用/评估阶段 → 租用云GPU
- →不确定?见下方回本时间表
- →比较云GPU服务商 →
任意配置的软件栈
硬件组装完成后,10分钟内即可让Ollama运行起来:
- 1安装Ubuntu 22.04 LTS或Windows 11(推荐Ubuntu以获得更稳定的CUDA支持)
- 2从nvidia.com安装550以上版本的NVIDIA驱动,或运行
ubuntu-drivers autoinstall - 3安装Ollama:
curl -fsSL https://ollama.com/install.sh | sh - 4拉取模型:
ollama pull qwen2.5:14b-instruct-q8_0 - 5以网络服务器模式运行:
OLLAMA_HOST=0.0.0.0 ollama serve - 6安装Open WebUI以获得浏览器界面:
docker run -d -p 3000:8080 --gpus all ghcr.io/open-webui/open-webui:cuda - 7通过Tailscale暴露服务,实现从任意设备安全远程访问
三种配置的性能对比
硬件性能与2026年早期测量结果一致——只有价格发生了变化。
模型 + 量化 | 入门档(约19300元) | 推荐档(约38000元) | 专业档(约62600元) |
|---|---|---|---|
| Llama 3.1 8B Q4 | 55–70 tok/s | 105–125 tok/s | 120–140 tok/s |
| Qwen3 14B Q8 | 20–28 tok/s | 48–60 tok/s | 55–70 tok/s |
| Qwen3 32B Q4 | 12–18 tok/s | 28–38 tok/s | 40–55 tok/s |
| Llama 3.3 70B Q4 | 5–8 tok/s(CPU) | 10–15 tok/s(CPU) | 25–40 tok/s(GPU) |
| Mixtral 8x22B Q4 | 15–22 tok/s | 32–45 tok/s | 45–60 tok/s |
总拥有成本:工作站 vs 云GPU
推荐档硬件成本自2026年5月以来上涨约29%(RAM和存储,而非GPU)——相对云端租赁的回本周期也随之改变。
使用强度 | 云端年费(A40 @ 0.44美元/时) | 工作站年电费 | 相对云端回本期 |
|---|---|---|---|
| 每天2小时 | 约2300元 | 约315元(@1元/度) | 约19年 — 云端更划算 |
| 每天4小时 | 约4600元 | 约630元 | 约10年 |
| 每天8小时 | 约9200元 | 约1260元 | 约5年 |
在2026年上涨的硬件价格下,纯成本计算要到每天约5小时以上使用才明显对工作站有利——低于此值云端租赁更划算。隐私、数据留存和不依赖云端可用性是独立于回本周期的选择本地的理由。
应该自建工作站还是租用云GPU?
常规使用(每天6小时以上):建议自建工作站。RunPod上A40 48GB租金约0.44美元/小时——每天4小时使用约需年费4600元。按2026年上涨后的硬件价格,约38000元的推荐档工作站在每天4小时使用下约10年回本,每天8小时使用则不到5年。偶尔使用(每天2小时以下):云服务更便宜。
为什么这套配置比其他2026年指南贵这么多?
是RAM和NVMe存储涨价,而非GPU。厂商将产能转向AI数据中心HBM芯片导致的2026年DDR5/NAND短缺,使64GB DDR5套装价格从2026年5月约1000元涨到8月约6000元,4TB NVMe硬盘从约1400元涨到约5700元。同期GPU价格保持平稳甚至略降。
入门档或专业档的RTX 3090应该买二手还是全新?
2026年二手是RTX 3090的标准选择——该型号2022年已停产,"全新"只是溢价出售的旧库存。二手卡价格约5000–7500元;负载下检查是否有异常风扇噪音或焦糊味(挖矿磨损迹象),并优先选择支持退货的卖家。
Ollama在双GPU上运行需要NVLink吗?
不需要。Ollama通过PCIe使用CUDA张量并行——无需NVLink。双RTX 3090配置完全不需要NVLink即可正常工作。
专业方案为什么用双RTX 3090而不是单RTX 4090?
显存是关键。两块RTX 3090合计48GB——足够装下Llama 3.3 70B Q4(约40GB)。单块RTX 4090只有24GB——70B无法不卸载直接运行。对于GPU速度的70B推理,双3090在显存/元的性价比上更优。
可以从预算方案升级到推荐方案吗?
可以——第一档和第二档都使用AM5接口,可以更换更好的GPU或增加内存而不需要更换主板。第三档使用TRX50接口,从第一/二档升级到第三档需要更换主板和CPU。
值得投入的升级(若预期会持续升级需求)
如果预计一年内会超出当前档位,以下三项升级值得投资:
- 内存:64GB → 128GB — 对推荐档上的CPU卸载70B模型有用,可将卸载速度从约10–15提升到约15–20 tok/s
- 存储:2TB → 4TB — 若同时保留3–4个以上大模型时很有用
- 散热:240mm → 360mm水冷 — 在推荐档和专业档尤为重要(长时间推理负载)
应该购买哪种工作站?
仍不确定?从推荐档RTX 4090配置开始——对大多数本地AI用户而言,它在性能、显存、功耗和可升级性之间提供最佳平衡。
相关阅读
- 2026年本地LLM最佳GPU购买指南 -- 适用于每个工作站等级的GPU购买指南
- 低配置PC最佳本地AI应用 -- 还没准备好完整工作站时的软件选择
- 2026年本地AI最佳Mac推荐 -- GPU工作站的Apple Silicon替代方案
- 运行本地大语言模型的最佳笔记本电脑:2026 购买指南 -- 在决定购买工作站之前的便携选择
- Qwen本地部署完整指南2026:Docker、API服务器、多GPU配置 -- 工作站搭建完成后的生产环境部署
