关键要点
- 利用率是最大的变量。 持续、近乎恒定的使用有利于购买;突发或难以预测的使用有利于租用——在比较价格之前先对实际预期利用率建模。
- 本地硬件的资本支出约为20万-40万+美元(8卡H100/H200服务器),另加报价单之外的15-30%电力、散热和支持开销。
- 预留云GPU合约在AWS、Azure、GCP、CoreWeave上,1-3年承诺期通常较按需价格折扣30-55%——但提前终止通常会丧失折扣和预付款。
- 在示例性的3年TCO模型中,盈亏平衡点落在持续利用率约55-65%附近——需结合自身电力成本、人力配置和谈判费率验证。
- 多数企业最终采用混合模式: 本地硬件按稳态基线负载配置,云端容量吸收季节性或不可预测的峰值。
- 这是一项财务建模决策,而非硬件采购决策——正确的第一步是搭建TCO模型,而不是先挑供应商。
快速事实
- 8卡H100/H200本地服务器资本支出: 视GPU显存档位和配置而定,约20万-40万+美元。
- 本地功耗: 8卡H100/H200 SXM5节点满载时功耗约10-12kW。
- 云端预留折扣区间: AWS、Azure、GCP、CoreWeave的1-3年承诺合约通常较按需价格折扣30-55%。
- 示例性盈亏平衡利用率: 下文模型中3年周期持续约55-65%。
- GPU硬件的常见折旧年限: 常见企业财务惯例为3年直线折旧——GPU代际更新足够快,更长折旧年限往往高估了剩余使用寿命。
- 本地部署的隐藏开销: 支持合约、网络架构和散热改造通常会在服务器硬件成本基础上再增加15-30%。
应该购买本地硬件,还是租用预留云GPU算力?
诚实的答案是"取决于利用率",下面的决策指南把这句话变成了一个具体的判断标准。 阅读两份清单——只要如实估计利用率,多数企业会更贴近其中一方。
选择本地部署的情况 / 选择云端的情况
以下情况使用本地LLM:
- •工作负载近乎持续运行——一个24/7对外提供服务的生产推理服务,利用率持续高于约55-65%
- •拥有(或能够组建)内部基础设施/运维团队来负责硬件生命周期、散热与故障响应
- •数据驻留或物理隔离要求使云端处理不仅是成本问题,更是合规问题
- •现有机房已具备(或可无需大规模基建即可补足)足够的电力和散热能力
以下情况使用云端模型:
- •工作负载是突发性、季节性,或仍处于研发/实验阶段——在自有硬件上利用率会明显低于50%
- •需要比硬件采购与交付周期更快的速度扩缩GPU算力
- •希望避免为长期形态仍不确定的工作负载做出多年期人员和场地投入
- •多区域部署比单纯的每GPU小时成本更重要——云端区域今天就可用,新建数据中心则不然
快速决策:
- →如果拿不准,且工作负载确实是全新的:先用云端预留或按需容量启动,实测2-3个月的真实利用率,再用真实数据而非预测来建立购买方案的模型。
如何计算租用与购买之间的盈亏平衡点?
利用率——GPU算力实际处于生产性工作状态的时间占比——是决定这一比较结果最关键的单一变量。 利用率20%的服务器要为80%时间闲置的硬件支付全额折旧和电力成本;只在使用时计费的云端算力没有这个问题,但会通过更高的单位小时价格来覆盖供应商自身的利用率风险。
盈亏平衡公式的核心思路:用满载的3年本地成本(资本支出+电力+散热+人力时间)除以100%利用率下满载的3年云端成本。这个比值大致就是两个选项成本相等时的利用率——低于它云端更便宜,高于它本地部署更便宜。
这是一项与你所在组织的电力成本、人力开销和谈判所得云端费率密切相关的建模练习——把下一节的算例当作可用自身数据重建的框架,而不是可以直接照搬的数字。
- 持续利用率高于约65%: 在下文模型中,本地部署几乎总是胜出——无论如何都要为闲置容量付费,而自有硬件的闲置成本低于云端的按小时计费。
- 利用率35-65%: 真正的"取决于"地带——决策前需用自己实际的电价、人力配置和谈判所得云端折扣重新建模。
- 利用率低于约35%: 云端几乎总是胜出——为大部分时间闲置的硬件支付全额资本支出和折旧,通常不划算。
12、24、36个月的TCO实际会是什么样?
一个示例性的8卡H100对比显示,本地部署的年度成本大致持平,而云端成本随使用量直接线性增长——分界点是利用率的函数,而不仅是经过的时间。 以下数字以25万美元的中位本地资本支出和3.50美元/GPU小时的混合预留云端费率作为示例基准——预算前请替换为自己获得的供应商报价。
在100%利用率下,云端成本累积很快:8卡GPU全年连续运行约为70,080个GPU小时,按3.50美元/GPU小时的预留费率计算约为每年24.5万美元——3年期满载云端承诺可能超过70万美元,远高于本地资本支出加开销。
- 阅读此表要看利用率这一列,而不只是周期。 在持续100%利用率下,本地部署在图中所有周期都更便宜。在30%利用率下,即使到36个月云端仍更便宜——这个示例模型中的分界点在约55-65%利用率附近,而不是固定的时间段。
- 在用于预算决策之前,请用自己的供应商报价、电价(美元/kWh)和人力配置重建此表——这里的数字是一个框架,不是报价单。
| 周期 | 本地TCO(示例) | 云端预留TCO(利用率100%) | 云端预留TCO(利用率30%) |
|---|---|---|---|
| 12个月 | 约29万美元(资本支出+1年开销) | 约24.5万美元 | 约7.4万美元 |
| 24个月 | 约32.5万美元(资本支出+2年开销) | 约49万美元 | 约14.7万美元 |
| 36个月 | 约36万美元(资本支出+3年开销) | 约73.5万美元 | 约22.1万美元 |
如果决定走本地部署,应该买什么硬件?
如果利用率测算指向购买,具体的硬件选型是本文不再重复展开的另一个问题。 Dell PowerEdge XE9680、联想ThinkSystem SR675 V3、HPE Cray XD670和Supermicro SYS-821GE-TNHR是提供8卡H100/H200 SXM5机架平台的四家厂商,价格区间约为20万-40万+美元——各厂商的具体规格、散热要求和网络架构选择,参见企业GPU服务器采购指南。
该指南详细讨论"选哪台服务器";本文回答的是"是否应该买服务器"——确定预算前建议两篇都读。
企业级预留云GPU有哪些选择?
AWS、微软Azure、谷歌云和CoreWeave都出售较按需价格有折扣的多年期承诺型GPU合约——各家的折扣和合约结构差异大到值得直接比较,而不是默认沿用现有云供应商。
- 适合选择AWS或Azure的情况: 核心基础设施已在其上运行——承诺折扣叠加在已有的企业协议和结算关系之上。
- 适合选择Google Cloud的情况: ML/数据流水线已在GCP上——在多数配置下,CUD会自动应用于匹配的用量,无需单独购买预留。
- 适合选择CoreWeave的情况: 工作负载是GPU优先型,且希望选择专门围绕GPU算力构建、而非通用型大型云厂商的供应商——由于定价仅提供报价,需直接确认当前H100/H200/GB200的可用性和合约条款。
- 这些供应商都没有公开企业级承诺合约的具体定价——上述每个折扣区间都是基于公开信息的参考近似值;预算前请获取正式报价。
| 供应商 | 承诺产品 | GPU选项 | 典型折扣区间 | 最适合 |
|---|---|---|---|---|
| AWS | EC2 Capacity Blocks for ML / Reserved Instances / Savings Plans | P5 (H100)、P5e (H200) | 较按需约30-50% | 已在AWS基础设施上标准化的团队 |
| Microsoft Azure | Reserved VM Instances(1年/3年) | ND H100 v5、ND H200 v5 | 较按量付费约30-45% | 已有Microsoft Enterprise Agreement的企业 |
| Google Cloud | Committed Use Discounts (CUD) | A3 (H100)、A3 Mega (H100) | 约37%(1年)至约55%(3年) | 数据/ML工具链已在GCP上的团队 |
| CoreWeave | 预留容量合约 | H100、H200、GB200 | 需谈判,仅提供报价 | 不想依赖大型云厂商的GPU优先型工作负载 |
哪种方案适合你的工作负载模式?
采购决策应匹配工作负载的实际形态,而不是预算规模。 以下四种模式覆盖了大多数企业AI部署场景。
| 工作负载模式 | 推荐路径 | 原因 |
|---|---|---|
| 大规模24/7推理 | 本地部署(或混合基线) | 在TCO模型中,持续利用率高于约55-65%持续有利于自有硬件而非预留云端 |
| 季节性/突发需求 | 云端(按需或短期预留) | 为一年大部分时间闲置的硬件支付全额资本支出,很少能胜过按小时计费的云端方案 |
| 研发/实验 | 云端(按需) | 工作负载的形态和规模仍不确定——多年期承诺会把猜测固定下来 |
| 多区域、合规驱动 | 云端(多区域预留) | 在多个司法辖区建立合规数据中心容量比使用现有云端区域更慢、更昂贵 |
本地部署加云端的混合方案是什么样的?
多数拥有持续性AI工作负载的企业最终会采用按稳态基线负载配置的本地硬件,并用云端容量吸收季节性或不可预测的峰值——而不是在两者之间做非此即彼的选择。 这样既能在高且可预测的利用率下获得本地部署的成本优势,又能保留云端的弹性,用于本会在一年大部分时间闲置的流量。
实践中的做法是:将本地采购规模定在能自信预测的24/7基线负载(利用率下限),并将超出该基线的突发流量导流至按需或短期预留的云端容量。这样可以避免为一年中只占一小部分时间的峰值负载而过度购买本地硬件。
- 基线规模测算: 在确定本地采购规模前,先测量2-3个月的实际中位数或较低百分位的持续负载——按峰值负载来定规模会违背混合模式的初衷。
- 峰值流量导流: 一个能在本地容量饱和时把超额流量路由到云端推理端点的API网关或负载均衡器,能让架构在运维上保持简单。
- 合约期限匹配: 云端部分保持较短期限或按需计价,而不是签订与本地相当的多年期预留合约——混合模式的意义在于云端一侧的灵活性,而不是把承诺翻倍。
- 每年重新评估: 随着工作负载成熟、利用率数据积累,合适的基线与突发比例会发生变化——把混合配比当作每年需要重新审视的模型,而不是一成不变的架构。
企业在这一决策上常犯哪些采购失误?
- 比较标价而非全负载TCO。 用不含电力、散热和人力开销的本地资本支出报价,去对比不含预留折扣的云端按需价格,得到的比较对任何一方都不公平。
- 按预测峰值负载而非实测基线为本地硬件定规模。 这会造成一年大部分时间闲置的过剩容量——恰恰是混合模式想要避免的陷阱。
- 在工作负载形态明确之前签下3年期预留云合约。 预留合约锁定的是费率;如果工作负载发生实质性变化,折扣和期限就会从节省变成负担。
- 在仅按费率比较云供应商时忽略出口流量费和锁定成本。 报价最低的每GPU小时费率,并不等于最低的总成本——尤其是当日后更换供应商需要重构数据流水线时。
- 把本地部署与云端的决策当作一成不变。 随着产品成熟,利用率模式会变化——上线时的正确答案,18个月后往往不再正确;要定期重新审视模型,而不是一次定终身。
常见问题
购买和租用GPU算力的盈亏平衡利用率是多少?
在使用25万美元本地服务器和3.50美元/GPU小时混合预留云端费率的示例性3年TCO模型中,盈亏平衡点落在持续利用率约55-65%附近——低于此值通常云端更便宜,高于此值通常本地部署更便宜。在把这个数字当作自己组织的答案之前,请用自己的电力成本、人力配置和谈判所得云端费率重新建模。
本地企业级GPU服务器把所有开销都算上实际要多少钱?
8卡H100/H200配置的硬件本身约为20万-40万+美元,支持合约、网络架构和散热改造通常还会再增加15-30%——各厂商具体价格参见企业GPU服务器采购指南。
预留云GPU合约相对按需价格实际能提供多少折扣?
据公开信息参考,AWS、Azure、Google Cloud的1-3年承诺折扣大致在30-55%之间,CoreWeave的预留价格需谈判,仅提供报价。这些供应商都不公开准确的企业合约定价——预算前请获取正式报价。
如果我们提前终止预留云GPU合约会怎样?
多数预留和承诺型云合约在提前终止时会追溯取消已谈定的折扣,某些合约结构下还会丧失任何预付款中未摊销的部分。签约前请确认具体的终止条款——这是决策中重要的一部分,而不是可以忽略的细则。
在企业规模下,本地硬件是否比云端租用更便宜?
这完全取决于持续利用率,而不仅是规模。高且可预测、近乎恒定的利用率有利于本地部署;突发性、季节性或实验性的工作负载有利于云端——因为闲置的自有硬件仍要承担全额折旧,而闲置的预留云端容量仍要按承诺费率计费——两者的差距比双方各自的宣传所暗示的要小。
本地部署加云端的混合方案是什么,什么时候适用?
混合方案是把本地硬件规模定在可预测的24/7基线负载上,并把季节性或不可预测的峰值导流到云端容量,而不是为峰值过度构建本地部署。它适合大多数同时存在明显需求波动的持续性企业AI工作负载,而这正是大多数生产级推理部署的情况。
出口流量定价如何影响购买还是租用的决策?
从云供应商网络中移出数据的出口流量费,对轻量API流量影响不大,但对经常在环境间迁移大型训练数据集或模型检查点的团队而言可能很可观——在比较供应商前,请把预期出口流量与每GPU小时费率分开建模。
多区域或合规驱动的部署是否应该默认选择云端?
通常应该。在多个司法辖区建立合规数据中心容量,比使用已具备供应商维护的数据驻留和合规认证的现有云端区域要慢得多、也贵得多——合规方面的内容参见我们的数据驻留与主权AI指南。
本地GPU服务器从下单到投产需要多长时间?
8卡配置的交付周期视GPU配额情况在数周到数月不等,此外还要加上内部采购、机架安装以及电力/散热就绪时间——与云端近乎即时的开通相比,要预算完整周期,而不仅是供应商的交付时间。
AWS、Azure和Google Cloud提供的承诺折扣是否都是同一种类型?
机制因供应商而异——AWS使用EC2 Capacity Blocks、Reserved Instances和Savings Plans;Azure使用Reserved VM Instances;Google Cloud的Committed Use Discounts在多数配置下会自动应用于匹配用量,无需单独购买预留。折扣区间大致相近(1-3年期约30-55%),但合约机制的差异足以影响灵活性——请比较实际合约条款,而不只是标榜的折扣率。
资料来源
- AWS EC2 Capacity Blocks for ML 定价 -- aws.amazon.com/ec2/capacityblocks
- Microsoft Azure Reserved VM Instances 定价 -- azure.microsoft.com/en-us/pricing/reserved-vm-instances
- Google Cloud Committed Use Discounts 文档 -- cloud.google.com/docs/cuds
- CoreWeave 定价 -- coreweave.com/pricing
- Dell PowerEdge XE9680 产品页面 -- dell.com/en-us/shop/ipovw/poweredge-xe9680
- Enterprise GPU Server Buying Guide 2026(PromptQuorum,内部)-- 硬件价格及电力/散热数据引用自该姊妹文章。