人人都会AI编程

19.4 供电与散热设计

更新时间:2026-07-09

如果把 GPU 比作算力中心的大脑,网络比作神经系统,那么供电与散热就是心肺循环。任何一个环节出错,轻则降频,重则烧毁价值千万的设备。随着单 GPU 功耗突破 700W(H100 SXM5 为 700W,H200 甚至更高),单机柜功率密度从几 kW 飙升至 40–100kW,供电与散热已经从“后勤保障”变成了制约集群规模、总拥有成本(TCO)和 PUE(电能利用效率)的核心设计变量

作为开发者或技术决策者,你不需要成为电力工程师,但必须看得懂供电方案、散热路线的选型逻辑,以及它们如何反噬你的算力预算。


一、供电设计:不只是“拉电线”

1. 供电层级:从市电到 GPU 核心的路径

电力进入算力中心需经过多级变换与分配,每一级都有损耗与可靠性要求:

市电 → 高压配电 → 变压器 → 低压配电 → UPS(不间断电源)→ PDU(电源分配单元)→ PSU(服务器电源)→ GPU 板卡 VRM(电压调节模块)

其中,开发者最该关注三个节点:

| 节点 | 功能 | 常见选型与要点 |
|------|------|---------------|
| UPS | 市电中断时无缝切换电池供电,防止训练中断导致数天进度报废 | 优先在线式双变换 UPS,或更先进的分布式 BBU(电池备份单元)方案;时长需支撑至柴油发电机启动,一般 5–15 分钟 |
| GPU 服务器电源(PSU) | 将 220V/380V 交流转为 12V/48V 直流供机内各部件 | 高功率密度(如 3kW 冗余模块),支持热插拔;对于 8×H100 服务器,PSU 总功率通常需 10kW+ |
| GPU 板载 VRM | 将 PSU 输出的低压直流进一步降压至 GPU 核心电压(约 0.8–1.2V),并提供数百安培的大电流 | 多相并联,低内阻,高动态响应;此处的散热和电磁干扰(EMI)设计直接决定 GPU 的超频稳定性和寿命 |

2. 供电架构:集中式 12V vs 高压直流 48V

随着单机柜功率暴涨,传统 12V 中间供电的损耗日益突出。当前两种路线并存:

  • 12V 轨架构:PSU 输出 12V 给主板,再由板上 VRM 降压供给 CPU/GPU。结构成熟,但当电流超过数百安培时,铜损(I²R)严重,传输效率下降,同时线缆和 PCB 发热剧增。
  • 48V 直流或 bus bar 方案:借鉴电信行业经验,采用 48V 中间电压,显著降低电流和线损。NVIDIA HGX 平台和部分 OCP(开放计算项目)服务器已开始支持 48V 输入,电源架可直接输出 48V,再由更靠近负载的 VRM 降压。这能提升约 2–3% 的能效,对万卡集群而言意味着一笔可观的电费节约。

实用建议:采购服务器时,务必确认 PSU 和机柜 PDU 的电压匹配与功率余量。若八卡服务器标称功率 10kW,余量应至少 20–30%,因为 GPU 瞬时功耗浪涌(300 微秒级)可达标称功率的 1.5 倍,不足可能触发 PSU 过流保护导致宕机。

3. 机柜功率密度与供电方案

机柜功率密度决定了单柜能塞多少台 GPU 服务器,进而影响网络布线和散热密度。典型场景:

| 机柜功率 | 可部署示例 | 供电方式 |
|---------|-----------|----------|
| 8–12kW (传统密度) | 2 台 4×A100 服务器(单台 4kW) | 单路三相 32A PDU |
| 25–40kW(高密度) | 1–2 台 8×H100 服务器(单台 10kW) | 双路三相 32A/63A PDU,或智能母线 |
| 60–100kW(超密度) | 液冷整机柜,8×H100×4 台服务器 | 专用高电流母排或液冷供电一体化 CDU |

坑点警示:不能只看额定功率。H100 的瞬时尖峰电流(约 500 微秒)可达稳态的 2 倍以上,如果 PDU 或断路器响应过于灵敏,会在正常负载下误触发跳闸。必须在设计初期与电气工程师确认动态负载特性,或在机柜端加装缓冲电容。


二、散热设计:风冷与液冷的路线之争

1. 风冷:仍是主流,但正在触及物理上限

风冷就是用风扇吹过散热片带走热量。它的优势是技术成熟、维护简单、单机故障隔离好。但当单个芯片 TDP(热设计功耗)超过 400W 时,风冷开始吃力:

  • 需要大温差或高风量:H100 SXM 模块的 TDP 700W,需要高转速暴力风扇,噪音可达 90 分贝以上,且对机房空气流通和冷热通道设计提出严苛要求;
  • 热岛效应:8 卡 GPU 密集成一排,中间卡若进风温度已因前排加热而升高,可能导致温度过高降频;
  • PUE(电能利用效率)难以突破 1.2:风冷需要强大的空调压缩机或水冷机组向机房送冷风,这部分制冷能耗通常占 IT 负载的 20–30%,PUE 常在 1.3 以上。

但风冷并非没有优化空间。先进的热通道封闭行级精密空调可以将 PUE 压到 1.15 左右。对于几十张卡规模、功率密度不高的集群,风冷仍是性价比首选。

2. 液冷:通往高密度、低 PUE 的必经之路

当单机柜功率超过 30kW,液冷几乎成为必选项。主流方案分两种:

| 方案 | 原理 | 冷却液接触部件 | PUE 潜力 | 典型场景 |
|------|------|:---:|:---:|---------|
| 冷板式液冷 | 冷板贴在 GPU/CPU 芯片顶部,内部流通冷却液(纯水或绝缘氟化液),通过 CDU 与外部冷却塔换热 | 不接触电子元件,仅通过冷板传导 | <1.1 | 当前主流,服务器改造小,现有数据中心可升级 |
| 浸没式液冷 | 整个服务器浸泡在绝缘冷却液中,液体直接带走所有热源的热量 | 全面浸泡 | 可逼近 1.02 | 超大规模部署,要求特殊设计的服务器和运维流程;目前成本高,主要用于创新示范 |

冷板液冷的工作原理

  1. CDU(冷量分配单元):作为一次侧(外部冷却塔/冷水机)与二次侧(去往机柜冷板)的热交换枢纽,控制冷却液的温度、流量、压力;
  2. 机柜级分配:进液总管分流到每个计算节点的冷板,吸热后热液返回 CDU;
  3. 温度控制:二次侧供液温度通常设定在 32–45°C,比芯片结温低 20°C 左右,既能避免结露,又能保证足够换热温差。

实用优势

  • 液冷可将芯片结温压低 20°C 以上,GPU 不会因温度墙而降频,实际可用算力更高;
  • 热量可通过热水回收用于建筑供暖,进一步降低 TCO;
  • 显著降低风扇功耗(液冷服务器仍保留低速风扇为其他组件散热),噪音大幅下降。

挑战与坑点

  • 漏水风险:必须采用压力检测、漏液检测绳、快速断开接头(QD)等措施;一个漏点可能毁掉整台服务器;
  • 水质与防腐:二次侧冷却液需要去离子、防生物生长、抗腐蚀,否则冷板内壁结垢或腐蚀导致热阻增大甚至穿透;
  • 运维改变:插拔冷板接头需要培训,冷却液排放和补充需专门流程;
  • 改造成本:传统风冷机房增加液冷 CDU 和管路需改造费用,且部分老机房楼板承重可能不满足高密液冷机柜重量(整套液冷机柜可达 1.5 吨以上)。

3. 风液混合:现实中的过渡方案

完全浸没式尚未普及,许多数据中心采用混合模式:风冷处理低功耗服务器和网络设备,液冷处理高功率 GPU 计算节点,共用一套冷冻水系统。或者在机柜内部使用液冷带走 GPU 和 CPU 热量,其余部件(内存、存储、电源)仍由低速风扇带走热量,即“液冷+风冷辅助”模式。


三、PUE 优化与能耗管理

PUE(Power Usage Effectiveness) 是最重要的能效指标:PUE = 数据中心总能耗 / IT 设备能耗。理想值是 1.0,亦即所有电力都用于 IT 设备。

典型 PUE 范围

  • 老旧风冷机房:1.5–2.0(一半以上电能被制冷和配电损耗吃掉)
  • 现代优化风冷:1.15–1.3
  • 冷板液冷:1.05–1.15
  • 浸没液冷:1.02–1.05

降低 PUE 的实用手段

  • 提高送风/供水温度:将冷通道温度从 22°C 提高到 27°C,每提升 1°C 约节省 4% 制冷能耗;
  • 自然冷却(Free Cooling):在气温较低的季节或地区,直接用室外冷空气或冷却塔散热,关闭或降载压缩机;
  • 高压直流(HVDC)或智能母线:减少交流-直流多次变换的损耗;
  • 动态制冷调节:根据负载自动调节风扇和水泵转速。

对预算的影响:假设一个 1000 卡 H100 集群,IT 负载约 1000×700W = 700kW。如果 PUE 从 1.4 降至 1.1,每年节约电费(按 0.7 元/kWh 估算)约为 700kW × (1.4-1.1) × 24h × 365d × 0.7元/kWh ≈ 128 万元人民币。这在集群全生命周期足以覆盖液冷改造成本。


四、规划清单与决策树

当你要为新集群选择供电与散热方案时,按以下顺序评估:

  1. 确定单服务器功率峰值(标称 + 20% 浪涌),乘上部署数量,得到总 IT 功率;
  2. 确定单机柜功率密度(总功率/机柜数),若超过 20kW,必须考虑液冷或降低部署密度(多占机柜,增加网络布线成本);
  3. 评估机房条件:楼板承重、层高、冷冻水管预留、电力容量;
  4. 计算 TCO:将建设成本(UPS、CDU、管路改造)与运营成本(电费、维护费)对比,通常三年为一个回收周期;
  5. PUE 目标:结合当地气候和政策要求(部分地区有 PUE 强制上限)。

一句话总结:供电与散热不再是机房工程师才需要关心的细节,而是决定你模型训练能否连续跑满数周、推理服务能否按时交付的物理基础。将电力和温控纳入容量规划,把 PUE 写进 KPI,是确保算力从“能用”到“经济地好用”的关键一步。