在 18.1–18.3 节中,我们完成了算力需求测算、集群定位与规模分级。接下来最现实的问题摆在决策者面前:把这些算力从纸面搬到地面,到底要花多少钱?更关键的是,初始买卡的钱往往只占总成本的一半甚至更少。如果预算表只列了 GPU 服务器报价,项目大概率会在第二年因电费或维保费用超支而陷入被动。
本节将算力中心全生命周期成本拆为四类,并给出可落地的 TCO(Total Cost of Ownership,总拥有成本)核算框架。这是你在向管理层要预算、对比公有云租赁与自建、或评估国产替代方案时,最直接的数据武器。
一、硬件成本:初始投资的“显性大山”
硬件是算力中心最直观的支出,通常占 初始 CAPEX(资本性支出)的 60%–75%。但它不是一张简单的“显卡报价单”,至少包含四个子项:
| 子项 | 内容 | 成本特征 |
|------|------|----------|
| 计算节点 | GPU 服务器(8/10/16 卡机型)、CPU 管理节点 | 绝对大头,单台 8 卡 A100/H800 节点通常占整柜投资的 70% 以上 |
| 网络设备 | InfiniBand(NDR/HDR)或 RoCE 交换机、光模块、网线 | 容易被忽视,但一套千卡集群的 IB 网络成本可能相当于数台 GPU 服务器 |
| 存储系统 | 并行文件系统服务器(Lustre/GPFS/JuiceFS 后端)、全闪/混闪阵列、对象存储 | 训练场景下,存储带宽不足会直接拖垮 GPU 利用率,不能省 |
| 安全与管理层 | 防火墙、堡垒机、带外管理交换机、监控采集服务器 | 占比小,但缺了它,集群就是“裸奔” |
实用认知:
- 训练集群的硬件成本高度向 GPU 和 IB 网络倾斜;推理集群则更看重显存密度和单卡性价比,可使用推理专用卡或消费级卡(如 RTX 4090/L40S)降低单卡成本。
- 国产替代的经济账:昇腾、寒武纪等国产芯片单卡价格可能低于同级 NVIDIA 卡,但需额外计算软件迁移、适配工程师人力和潜在的性能损失。硬件便宜不代表 TCO 低。
- 警惕“卡价幻觉”:市场波动(如出口管制导致的溢价)会让同一型号 GPU 在半年内价格浮动 20%–50%。预算应预留 10%–15% 的弹性空间。
二、机房成本:被低估的“空间税”
机房成本取决于你是自建机房、租用第三方 IDC,还是在公有云裸金属/托管。
| 模式 | 适用场景 | 成本构成 |
|------|----------|----------|
| 自建机房 | 千卡级以上、长期持有、有地产或园区资源 | 土建/改造、电力增容、精密空调、消防、UPS、机柜、布线,一次性投入极高 |
| 租用 IDC 机柜 | 百卡到千卡级,追求快速上线 | 按机柜功率(kW/月)或按整机柜租金计费,一线城市与中西部价差可达 2–3 倍 |
| 公有云/托管 | 初期验证、需求波动大 | 折算到小时租金,单价最高,但避免了重资产 |
核心变量:功率密度。传统 IDC 机柜按 4–6 kW 设计,而 8 卡 H100 服务器单台就可能 3 kW+,一柜放不下几台。如果 IDC 无法提供 20 kW–40 kW 高功率机柜,你就需要租用更多机柜空间,直接导致机房成本线性上升。
选址建议:如果业务允许,将训练集群部署在中西部能源富足地区(如内蒙古、贵州、宁夏),利用“东数西算”政策降低机柜租金和电价。推理集群因需要低延迟,建议贴近用户端部署。
三、能耗成本:长期运营的“沉默杀手”
这是最容易被低估、但往往在 3 年内反超硬件成本 的支出项。
算电费的公式很简单:
年电费(元)= 总 IT 负载功率(kW)× PUE × 8760 h × 电价(元/kWh)
拆开看三个乘数:
- 总 IT 负载功率:把所有 GPU 服务器、存储、网络的额定功率加总。注意:训练任务通常让 GPU 常年跑在 80%–90% 负载,而推理集群可能有明显峰谷,需按实际利用率折算。
- PUE(Power Usage Effectiveness):数据中心总能耗 / IT 设备能耗。
- 传统风冷:1.4–1.6
- 高效风冷+自然冷却:1.2–1.3
- 液冷(冷板式/浸没式):1.05–1.15
PUE 每降低 0.1,一个 1MW 的集群每年可节省电费数十万元。
- 电价:工业用电各地差异巨大,从 0.35 元/度(西部直供电)到 1.0+ 元/度(一线城市商业用电)不等。
举例:一个 128 卡 A100 集群,IT 负载约 80 kW,若 PUE=1.5,电价 0.6 元/度:
- 年电费 = 80 × 1.5 × 8760 × 0.6 ≈ 63 万元/年
- 5 年电费 ≈ 315 万元,很可能超过当初买 GPU 的钱。
结论:在选址和散热方案(19.4 节将展开)上省下的每一分钱 PUE,都会在第三年变成真金白银的利润。
四、运维成本:隐形的“持续性失血”
运维成本是 OPEX(运营支出)的重要组成部分,通常占 年度运营预算的 15%–25%,却最难在立项时量化。它包括:
| 类别 | 具体内容 | 参考占比 |
|------|----------|----------|
| 人力成本 | GPU 集群工程师、网络工程师、存储工程师、系统/调度开发、值班运维 | 运维成本中的最大头,小型集群至少需 3–5 人,千卡级需 10 人以上 |
| 硬件维保 | 原厂质保过期后的续保(GPU、IB 交换机、存储),通常按硬件价值的 5%–10%/年 计算 | 中头 |
| 备件库存 | GPU、网卡、光模块、电源、风扇等易损件 | 建议预留硬件投资的 2%–3% 作为备件资金 |
| 软件授权 | 部分并行文件系统、集群调度软件、监控平台、安全软件的商用授权 | 视选型而定,开源方案可大幅降低 |
| 网络带宽 | 公网出口、专线(上传训练数据、下载开源权重)、跨机房互联 | 数据密集型业务不可忽视 |
| 其他 | 耗材、差旅、培训、应急演练 | 小额但需预留 |
真实教训:很多团队在立项时只算了“买机器的钱”,上线后才发现:
- IB 交换机过保后维修一次报价数万元;
- 某批次 GPU 风扇故障率高,需要囤备件;
- 模型 checkpoint 定期回传公有云做异地备份,流量费惊人。
这些都应该在 18.4 的预算表里提前列支。
五、TCO 核算框架:把四类成本归一到同一维度
决策时不能孤立比较硬件价格,而应统一折算为 3 年或 5 年 TCO。推荐模型如下:
TCO(N 年) = 硬件 CAPEX + 机房 CAPEX(或首年机房租金) + N ×(年能耗成本 + 年运维成本) – 残值回收
若采用融资租赁或分期付款,需把资金成本(利息)计入。
一个百卡级训练集群的粗略成本结构参考(以 3 年周期、租用 IDC 模式为例):
| 成本大类 | 占 3 年 TCO 比例 | 备注 |
|----------|------------------|------|
| 硬件采购 | 35%–45% | 含服务器、网络、存储,一次性投入 |
| 能耗电费 | 30%–40% | 持续流出,PUE 和选址决定上限 |
| 机房租金 | 8%–12% | 若自建则替换为折旧摊销 |
| 运维人力+维保+备件 | 10%–15% | 随集群复杂度上升 |
| 网络/软件/其他 | 3%–5% | |
注:若选址在西部低电价地区且采用液冷(PUE≈1.1),能耗占比可压到 25% 以下;若在一线城市风冷老机房(PUE≈1.6),能耗占比可能突破 45%。
六、成本优化的四个现实策略
基于上述核算模型,在规划阶段即可介入降本:
1. 精确匹配训练/推理负载,避免“卡等数据”或“卡空转”
利用率每提升 10%,相当于硬件折旧和机房租金被摊薄 10%。混布训练与推理、采用弹性调度(20.3 节)是核心手段。
2. 用“东数西算”逻辑拆分集群
训练集群去西部(省电费、省机柜租金),推理集群在东部(省延迟)。数据通过专线或物理搬迁同步。
3. 液冷不是炫技,是 ROI 账
冷板式液冷初期投入比风冷高 20%–30%,但在高功率密度场景下,3 年省下的电费通常能覆盖额外投资。
4. 认真对比“自建 vs 租赁”
如果业务需求波动大、模型迭代方向不确定,或团队缺乏 Infra 运维能力,公有云训练集群或算力租赁的 3 年 TCO 可能反而更低——尽管单价看起来贵,但它把 CAPEX 转化为 OPEX,并省下了人力和电费。
七、小结
算力中心的成本不是一次性的“买卡”行为,而是一个 CAPEX 与 OPEX 并重的长跑:
- 硬件成本决定了你能不能起跑;
- 机房与能耗成本决定了你能跑多远;
- 运维成本决定了你跑的时候会不会意外崴脚。
在提交建设方案前,建议用本节 TCO 模型做一张 5 年现金流测算表,把四类成本按年拆解。这不仅是为了申请预算,更是为了在第三年集群满负荷运转时,你不会因为一张巨额电费单而被迫砍算力。
当成本账算清楚后,下一步就是把这些钱转化为具体的物理架构——第 19 章将从服务器选型、网络拓扑到散热设计,讲解如何让每一分投入都落在刀刃上。