关键要点
- GPU密度: 四家厂商都拥有8-GPU SXM5旗舰平台(Dell XE9680、HPE Cray XD670、Supermicro SYS-821GE-TNHR);Lenovo和HPE还销售密度更低、成本更低的PCIe平台。
- 价格区间: 一台8x H100/H200 SXM5服务器的价格大致在20万至40万美元以上,取决于GPU显存(80GB H100 vs 141GB H200)和支持等级。
- 制冷才是真正的瓶颈。 两三台8-GPU SXM5服务器就已超过风冷每机架约20-40kW的实际上限——超过这个密度,液冷就不再是可选项,而是必需品。
- 网络对训练更重要,对推理影响较小。 多节点训练集群需要InfiniBand NDR或RoCE v2以太网结构;单节点推理则不需要。
- 根据工作负载而非仅凭预算选GPU。 L40S(48GB、PCIe、风冷)适合推理;H100/H200(80-141GB、SXM5、NVLink)适合训练和大批量服务。
- 只需要一两块GPU推理算力的买家根本不该购买机架服务器——工作站方案才是这一规模的合适选择。
📍 简单一句话
企业GPU服务器买家应根据工作负载而非品牌来选择厂商——Dell PowerEdge XE9680、HPE Cray XD670和Supermicro SYS-821GE-TNHR在20万至40万美元以上的8x H100/H200 SXM5训练平台上直接竞争,而搭载PCIe L40S的HPE ProLiant DL380a Gen11和Lenovo ThinkSystem SR675 V3则以约三分之一到一半的价格覆盖纯推理预算。
💬 简单来说
为企业采购一台AI服务器,和攒一台高性能游戏电脑完全不是一回事。这类机器的花费堪比一套房子,到货前就需要制冷和用电方案,还附带多年的支持合同。本指南比较了真正销售这类机架式AI服务器的四家公司——Dell、Lenovo、HPE和Supermicro——帮助采购者根据实际用途(为员工运行AI模型,还是从零训练新模型)而不是单纯看谁的规格表更大,来选择合适的规模和厂商。
速览事实
- Dell PowerEdge XE9680: 6U,最多8x H100/H200 SXM5,双路Intel Xeon Platinum,最高4TB DDR5。
- Lenovo ThinkSystem SR675 V3: 3U,最多8块GPU(可混搭H100/H200/L40S),双路AMD EPYC 9004/9005,最高6TB DDR5,可选Neptune液冷。
- HPE Cray XD670: 5U,最多8x H100/H200 SXM5,双路第4代Intel Xeon,可选InfiniBand NDR / Slingshot 11 / 以太网网络方案。
- HPE ProLiant DL380a Gen11: 2U,最多4块双宽或8块单宽GPU(L40S/H100 PCIe),双路Intel Xeon最多64核。
- Supermicro SYS-821GE-TNHR: 8U,最多8x H100/H200 SXM5,双路第4/5代Intel Xeon,最高8TB DDR5。
- GPU显存: H100 = 80GB HBM3;H200 = 141GB HBM3e;L40S = 48GB GDDR6。
- 机架功耗: 一台8x H100/H200 SXM5节点满载功耗约10-12kW——两台就已超过单个机架风冷的实际上限。
不同使用场景该买哪款GPU服务器?
合适的厂商取决于工作负载和数据中心的准备程度,而非品牌偏好。 训练集群、纯推理部署和已具备液冷条件的数据中心,分别指向不同的平台。
- 大规模多节点训练首选: Dell PowerEdge XE9680——拥有最广泛的企业销售和系统集成商网络,适合搭建InfiniBand互联的多机架集群。
- 已具备液冷条件的数据中心首选: Lenovo ThinkSystem SR675 V3——Neptune直接芯片液冷在持续高GPU利用率下能显著降低制冷成本,并可选配AMD EPYC处理器。
- 纯推理或较小规模首次采购首选: HPE ProLiant DL380a Gen11——2U,风冷,PCIe GPU,成本大约是8x SXM5训练机型的三分之一到一半。
- 配置灵活性和价格竞争力首选: Supermicro SYS-821GE-TNHR——通过系统集成商渠道提供最广泛的按需定制选项,往往是获得8x H100/H200 SXM5配置最具价格竞争力的途径。
- 以下情况请完全避开机架服务器: 如果实际需求只是为小团队提供1-2块GPU的推理算力,本地LLM工作站搭建方案成本只是零头,也无需数据中心级制冷方案。
四家厂商在规格和价格上如何对比?
Dell、Lenovo、HPE和Supermicro都至少拥有一款8-GPU SXM5平台,但在外形规格、制冷选项和销售渠道上差异明显。
| 厂商/型号 | 外形规格 | 最大GPU数 | GPU选项 | 制冷方式 | 价格区间 |
|---|---|---|---|---|---|
| Dell PowerEdge XE9680 | 6U | 8(SXM5,NVLink) | H100 80GB / H200 141GB | 标配风冷,可选液冷 | 约20万-37.5万美元(8GPU) |
| Lenovo SR675 V3 | 3U | 8(PCIe或SXM) | H100 / H200 / L40S | 风冷或Neptune液冷 | 因配置差异很大 |
| HPE Cray XD670 | 5U | 8(SXM5,NVLink) | H100 80GB / H200 141GB | 标配风冷 | 仅提供报价 |
| HPE ProLiant DL380a Gen11 | 2U | 4双宽/8单宽 | L40S / H100 PCIe | 仅风冷 | 更低——仅提供报价 |
| Supermicro SYS-821GE-TNHR | 8U | 8(SXM5,NVLink) | H100 80GB / H200 141GB | 标配风冷 | 约20万-32万美元(8GPU) |
Dell PowerEdge XE9680提供什么?
Dell PowerEdge XE9680是一款6U机架服务器,搭载8块通过NVLink互联的NVIDIA HGX H100或H200 SXM5 GPU,专为大模型训练和推理而设计。 它将GPU与两颗第4或第5代Intel Xeon Scalable处理器(每颗最多56核)、最多32根DDR5内存插槽(最高4TB,4800 MT/s)以及10个PCIe Gen5 x16插槽(用于网络和存储扩展)搭配在一起。
标配风冷出厂;对于机架功耗超过约20-30kW、风冷已不再实用的数据中心,Dell提供液冷选项。
价格不公开——经销商和系统集成商对满配8x H100/H200机型的报价大致在20万至37.5万美元之间,具体取决于GPU显存档位、内存、存储和支持等级。预算前请通过Dell.com获取正式报价。
Lenovo ThinkSystem SR675 V3提供什么?
Lenovo ThinkSystem SR675 V3是一款3U机架服务器,支持最多8块双宽或单宽GPU——包括NVIDIA H100、H200和L40S——搭配两颗第5代AMD EPYC 9004/9005处理器,以及最高6TB、24根DIMM插槽的DDR5-4800内存。
其显著特点是Lenovo Neptune,一种可选配的直接芯片液冷及混合液气冷系统——对于设施已经运行液冷回路、或计划添加液冷的买家而言尤为重要,因为相比纯风冷,它能在持续高GPU利用率下显著降低制冷成本。
SR675 V3还支持混合GPU配置(H200四卡NVLink配置,或面向推理的L40S配置),使其成为本对比中配置灵活性最高的平台,适合希望用同一个机箱系列同时覆盖训练和推理的买家。可在Lenovo.com配置。
HPE Cray XD670和ProLiant DL380a Gen11提供什么?
HPE销售两个不同层级的GPU服务器:面向大规模训练的Cray XD670,以及面向推理和较小规模部署的ProLiant DL380a Gen11。
Cray XD670是一款5U机箱,搭载8块NVIDIA H100或H200 SXM5 GPU,配备两颗第4代Intel Xeon处理器。其显著特点是网络结构可选——8个PCIe Gen5半高插槽支持HPE Slingshot 11、InfiniBand NDR或标准以太网——对于已在现有HPE Cray超算体系中标准化使用Slingshot的买家尤为相关。
ProLiant DL380a Gen11是一款2U服务器,支持4块双宽或8块单宽GPU(L40S或H100 PCIe)、最高3TB DDR5和PCIe 5.0——适合推理工作负载或还不足以采购8-GPU SXM5平台的首次GPU采购,提供风冷、低密度的选项。两款机型均可在HPE.com查看。
Supermicro SYS-821GE-TNHR提供什么?
Supermicro SYS-821GE-TNHR是一款8U机架服务器,最多支持8块NVIDIA HGX H100(80GB)或HGX H200(141GB)GPU、两颗第4或第5代Intel Xeon Scalable处理器,以及最高8TB、32根DIMM插槽的DDR5-5600内存——是本次对比的四款平台中最大内存容量的机型。
Supermicro主要通过系统集成商和经销商渠道销售,而非直接的企业销售团队,这通常意味着更灵活的按需定制空间(硬盘位、网卡、电源冗余),而且根据当前经销商报价,其8x H100配置的起价往往更具竞争力——基础配置报价大致在20万至32万美元之间,满配价格更高。
存储是其一大优势:最多19个2.5英寸热插拔NVMe/SATA/SAS硬盘位外加2个M.2插槽——适合需要在推理或微调之外并行运行大规模本地数据集的买家。基础配置详见Supermicro.com。
该买H100、H200还是L40S?
H200在显存和带宽上占优,H100是更易获取、通常也更便宜的SXM5选项,而L40S是面向纯推理的风冷PCIe选择。 截至2026年9月,三者都是NVIDIA当前在售的数据中心GPU;没有一款即将停产,因此选择的关键在于工作负载匹配度,而非过时风险。
- 选H200的情况: 服务大上下文工作负载,或训练更大模型时80GB/GPU会导致你想避免的跨GPU分片。
- 选H100的情况: 需要在多节点NVLink/InfiniBand训练集群中获得最广泛的厂商和经销商可得性,且80GB/GPU足以满足模型规模。
- 选L40S的情况: 工作负载仅为推理,数据中心只有风冷条件,且48GB/GPU在计划的量化水平下能容纳最大模型。
| GPU | 显存 | 显存带宽 | 最适合场景 |
|---|---|---|---|
| NVIDIA H100 SXM5 | 80GB HBM3 | 3.35 TB/s | 多节点训练,可获取性最高 |
| NVIDIA H200 SXM | 141GB HBM3e | 4.8 TB/s | 大上下文服务,更大批量训练 |
| NVIDIA L40S | 48GB GDDR6 | 864 GB/s | 风冷PCIe推理,预算更低 |
GPU高密度机架需要多少电力和制冷?
一台8-GPU H100/H200 SXM5服务器满载功耗约10-12kW——仅8块700W的GPU就占用5.6kW,还不算CPU、内存和风扇。 一个机架内放两三台这样的服务器就已超过风冷的实际上限。
行业数据显示,风冷的实际上限大致为每机架20-40kW;超过这个范围就需要液冷(直接芯片或浸没式),可支持每机架100-200kW以上。作为参考,NVIDIA的GB200 NVL72机架级系统总功耗约120-130kW——这是AI机架密度发展方向的一个参考点,而非本文所比较的任何服务器的规格。
对买家的实际启示:如果计划在一个机架内安装超过一两台8-GPU SXM5服务器,应规划直接芯片液冷方案(Lenovo Neptune,或设施级液冷回路),而不是假设数据中心的标准风冷系统能够应付。
需要InfiniBand还是标准以太网?
单节点推理部署不需要InfiniBand——标准100/200GbE以太网就已足够。 多节点训练或微调集群中,多台服务器上的GPU需要不断同步梯度,因此需要专用的高带宽、低延迟网络结构。
该网络结构有两个选项:InfiniBand NDR(每链路400Gb/s,传统HPC首选,旗舰平台通常每GPU配一个网卡)和RoCE v2(基于融合以太网的RDMA——例如NVIDIA Spectrum-X——可在你的网络团队可能已经运营的标准以太网结构上提供相近的吞吐量)。
- 使用InfiniBand NDR的情况: 正在搭建专用的多节点训练集群,希望获得该规模下最成熟、部署最广泛的RDMA网络结构。
- 使用RoCE v2(以太网)的情况: 团队已经运营融合以太网网络,希望避免维护独立的InfiniBand网络结构及相关技能团队。
- 两者都不需要的情况: 只运行单节点推理——标准网络已经足够,额外的网络结构成本不值得投入。
如何根据工作负载确定GPU服务器采购规模?
采购规模应匹配工作负载,而不是选择可购买的最大配置。 纯推理部署与训练/微调部署在GPU、内存和网络方面的需求根本不同。
- 1先对工作负载分类
Why it matters: 纯推理(为用户提供固定模型服务)所需的GPU显存远少于训练或微调,后者除了模型权重外还需保存梯度和优化器状态,也不需要多节点网络结构。 - 2根据模型规模和量化水平估算GPU显存需求
Why it matters: 一个700亿参数模型在FP16精度下,不算开销就需要约140GB显存——这直接排除了单卡L40S(48GB),意味着需要多GPU H100/H200分片,或改用更小/量化后的模型。 - 3决定采用单节点还是多节点
Why it matters: 如果单台8-GPU服务器的总显存能覆盖模型和并发目标,可以完全跳过InfiniBand/RoCE,节省网络结构成本;如果不能,则应从一开始就为专用网络结构留出预算。 - 4下单前将制冷方案与机架密度匹配
Why it matters: 在承诺每机架部署超过一两台8-GPU SXM5服务器之前,应与设施团队确认目标机架是否支持液冷——交付后再改造制冷系统,成本远高于提前规划。 - 5获取正式报价并确认交付周期
Why it matters: 这些厂商都不公开8-GPU配置的标价,而GPU高密度服务器的交付周期根据GPU分配情况可能从数周到数月不等——预算时不仅要考虑价格,也要考虑时间表。
应该选择哪种保修和支持等级?
四家厂商都在基础硬件保修之外提供分层的企业支持,但等级名称、响应时间和包含的服务各不相同——由于计划会调整,购买前请直接向厂商确认当前条款。
- Dell在XE9680上销售ProSupport等级(包括响应更快的关键任务选项)——请明确询问GPU服务器专属支持,而非标准PowerEdge等级。
- Lenovo为ThinkSystem系列销售Premier Support等级,提供现场响应和主动监测选项。
- HPE通过Pointnext Complete Care销售支持,并提供HPE GreenLake作为按用量付费的替代方案,适合希望避免六位数前期支出的买家。
- Supermicro的支持条款比其他三家厂商更依赖具体经销商/系统集成商而有较大差异,因为其大部分销量通过该渠道而非直接企业销售完成——请从具体经销商那里以书面形式获取支持条款,而不仅仅参考Supermicro的基础保修页面。
- 无论选择哪家厂商,都应具体询问GPU故障时会发生什么(更换SLA、是否需要寄回整个节点还是仅GPU托架)——这是GPU高密度服务器最可能实际发生的故障模式。
企业买家常犯哪些错误?
- 为纯推理工作负载购买8-GPU SXM5算力。 如果只是为用户提供固定模型服务,像ProLiant DL380a Gen11这样的2U PCIe平台就能以更低的价格和复杂度覆盖需求。
- 在确认机架制冷能力前就下单。 同一机架内的第二台或第三台8-GPU SXM5服务器可能超过风冷的实际上限——应在硬件到货前而非到货后与设施团队确认。
- 为"以后可能要扩容"的集群省略网络结构预算。 在已部署的单节点机群上事后追加InfiniBand或RoCE,比在最初采购时就纳入预算更具破坏性。
- 把标价当作总成本。 支持合同、网络结构、制冷改造和电力基础设施升级通常会在服务器硬件项之外再增加15-30%的成本。
- 认为H200总是比H100更好的升级选择。 如果模型和批量大小能够轻松容纳在80GB/GPU以内,H200额外的显存和成本并不会带来任何好处——在支付溢价之前先核实真实的显存需求。
常见问题
企业推理与训练分别需要多少块H100或H200 GPU?
为适中数量的并发用户提供固定模型服务的纯推理部署,通常1-4块GPU就够了,根本不需要8-GPU SXM5平台。训练或微调大模型(700亿参数以上)通常需要完整的8-GPU NVLink配置,以在GPU间分摊模型权重、梯度和优化器状态。采购规模应由工作负载决定,而不是默认"买最大的平台"。
一台8-GPU H100机架服务器的实际总成本是多少?
经销商和系统集成商对满配8x H100机型的报价,仅硬件本身大致在20万至37.5万美元之间,还不包括支持合同、网络结构以及任何制冷基础设施升级——这些通常还会再增加15-30%。四家厂商都不公开标价;预算前请获取正式报价。
GPU高密度机架需要液冷吗?
如果计划在一个机架内安装超过一两台8-GPU H100/H200 SXM5服务器,就需要——每台满载功耗约10-12kW,而风冷的实际上限大致为每机架20-40kW。低于这个密度,标准风冷仍可能可行;下单前请与设施团队确认。
网络该选InfiniBand还是以太网(RoCE)?
单节点推理两者都不需要——标准以太网就已足够。多节点训练集群中,InfiniBand NDR是该规模下最成熟、部署最广泛的高带宽RDMA网络结构;如果网络团队想避免维护独立的InfiniBand网络结构,以太网上的RoCE v2是替代方案。
Dell vs Lenovo vs HPE vs Supermicro——哪家厂商的企业支持最好?
Dell、Lenovo和HPE分别通过直接客户团队销售分层企业支持(分别为ProSupport、Premier Support和Pointnext Complete Care)。Supermicro主要通过系统集成商和经销商销售,因此支持条款按经销商差异较大,而非统一的Supermicro等级——购买前请从具体经销商处以书面形式获取支持条款。
H100 vs H200 vs L40S——该买哪种GPU?
如果服务大上下文场景,或训练时80GB/GPU会导致你想避免的跨GPU分片,选H200(141GB HBM3e)。如果80GB已经足够,且需要在多节点训练集群中获得最广泛的厂商和经销商可得性,选H100(80GB HBM3)。如果预算较低且仅做推理,选L40S(48GB GDDR6、PCIe、风冷)。
同一机架或服务器内可以混用不同型号的GPU吗?
在单台服务器内不行——8-GPU SXM5平台是围绕单一GPU型号(全部H100或全部H200)通过NVLink构建的,不能混用。在同一机架内可以——只要每台服务器的制冷和功耗分别核算,你可以让一台配置H100/H200用于训练的服务器,和另一台配置L40S用于推理的服务器共处一个机架。
企业买家应该选择哪种保修和支持等级?
至少应确认厂商针对GPU故障(而非一般硬件故障)的具体更换SLA——GPU故障是GPU高密度服务器最可能实际发生的故障模式,而更换物流(寄送GPU托架还是整个节点)因厂商和等级而异。响应时间等级应与工作负载实际能承受的停机时间相匹配。
在企业规模下,本地部署硬件是否比云GPU租用更便宜?
这取决于利用率,而不仅仅是标价——本地部署硬件前期成本高但运行后每小时成本低,而云端租用没有前期成本但每小时费率高得多。收支平衡点通常出现在持续、接近满负荷利用的情况下;偶发或突发性的工作负载通常租用更划算。详细成本对比请见我们的云GPU租用指南。
8x H100或H200配置的交付需要多久?
GPU高密度服务器的交付周期根据GPU分配情况和当前需求,从数周到数月不等——对大多数厂商而言,8-GPU配置都不是现货商品。请将交付周期作为正式报价的一部分加以确认,并据此为项目时间表做预算,而不仅仅是价格。
资料来源
- Dell PowerEdge XE9680产品页 -- dell.com/en-us/shop/ipovw/poweredge-xe9680
- Lenovo ThinkSystem SR675 V3产品指南 -- lenovopress.lenovo.com/lp1611-thinksystem-sr675-v3-server
- HPE Cray XD670 QuickSpecs -- hpe.com/us/en/hpe-cray-xd670.html
- HPE ProLiant DL380a Gen11数据表 -- hpe.com/us/en/compute/hpe-proliant-compute/dl380a-gen11.html
- Supermicro SYS-821GE-TNHR数据表 -- supermicro.com/en/products/system/datasheet/SYS-821GE-TNHR
- NVIDIA H100/H200 Tensor Core GPU规格 -- nvidia.com