人人都会AI编程

16.4 GPU 互联技术:NVLink、PCIe、InfiniBand 的带宽差异与作用

更新时间:2026-07-09

在 16.1 节中,我们将大模型训练的硬件瓶颈归结为三类:计算瓶颈、显存瓶颈与通信瓶颈。当单张 GPU 的显存与算力都无法装下整个模型时,分布式训练(详见第 9 章)成为唯一路径,而分布式本质上就是把“单机难题”转化为“多机通信问题”。此时,GPU 之间的互联带宽直接决定了分布式训练的效率上限——它相当于连接多颗 GPU 大脑的“神经轴突”,带宽不足,算力再强也会大量浪费在数据等待上。

业界主流的 GPU 互联方案可分为三个层级:机内通用总线 PCIe、机内高速直连 NVLink,以及跨机网络 InfiniBand。它们不是互相替代的关系,而是各有明确分工的“三级高速公路体系”。


一、PCIe:通用但拥挤的“省道”

PCI Express(PCIe)是服务器内部最通用的互联总线。CPU 与 GPU 之间、GPU 与网卡/NVMe 之间,甚至多卡之间(在无 NVLink 时)都依赖它通信。

技术特点

  • 通用性最强:所有 x86 服务器和 GPU 都原生支持,无需额外硬件。
  • 带宽有限且共享:以 PCIe 4.0 x16 为例,单向理论带宽约 32 GB/s,PCIe 5.0 x16 约 64 GB/s。这是总线共享带宽,多设备并发时会进一步瓜分。
  • 协议开销与拓扑瓶颈:PCIe 基于树形拓扑,GPU 间点对点通信往往需经过 CPU Root Complex 中转,延迟较高;虽然支持 P2P(Peer-to-Peer),但效率远不及专用互联。

在大模型场景中的定位

  • CPU-GPU 数据通路:训练数据从主机内存到显存的加载、Checkpoint 的读写,都走 PCIe。
  • 单卡/双卡小模型推理与微调:如 RTX 4090 工作站,PCIe 足以承载参数加载和低频梯度同步。
  • 分布式训练的短板:若尝试用 PCIe 做多卡张量并行(TP),AllReduce 通信会成为明显瓶颈,GPU 大量时间处于空等状态,MFU(模型算力利用率)骤降。

二、NVLink:机内 GPU 的“专用高铁”

NVLink 是 NVIDIA 专有的高速互联技术,用于解决单机内部多 GPU 之间的点对点(P2P)通信瓶颈。从 Pascal 时代引入,到 Ampere(A100)和 Hopper(H100)已成为数据中心 GPU 的标配。

技术特点

  • 超高带宽:A100 搭载第三代 NVLink,单卡对外总带宽达 600 GB/s(双向);H100 的第四代 NVLink 提升至 900 GB/s。作为对比,PCIe 4.0 x16 仅 32 GB/s,NVLink 快了约 20 倍。
  • 直接全互联:通过 NVSwitch 芯片,单机 8 卡或 16 卡可实现全互联拓扑(任意两卡直接通信,无需经过 CPU),极大降低延迟与拥塞。
  • 显存统一寻址:NVLink 支持 GPU 以统一虚拟地址访问其他 GPU 的显存,为超大模型推理时的显存池化(Memory Pooling)提供硬件基础。

在大模型场景中的定位

  • 张量并行(TP)的物理基础:第 9 章提到,TP 需要在每层前向/反向传播时进行高频的 AllReduce/AllGather。NVLink 的带宽和 P2P 特性使得 TP 通常被严格限制在单机 NVLink 域内(如 8×A100/H100 服务器),跨机做 TP 会因网络带宽不足而严重降速。
  • 单机训练标配:无论是 Megatron-LM 还是 DeepSpeed,在单机 8 卡上做 TP=8,都依赖 NVLink 才能将通信开销压到 10% 以内。

注意:NVLink 是 NVIDIA 专有生态,仅存在于 A100/H100/H200 及 RTX 3090/4090(后者带宽和拓扑大幅弱于数据中心版)。国产 GPU 目前暂无严格对等的机内全互联方案。


三、InfiniBand:跨机集群的“洲际光缆”

当模型大到需要 64 卡、512 卡甚至千卡集群时,单机 NVLink 域已无法容纳,必须通过机间网络互联。InfiniBand(IB) 是目前大模型训练集群的事实标准。

技术特点

  • 高带宽与极低延迟:主流从 HDR(200 Gbps/口)向 NDR(400 Gbps/口)乃至 XDR(800 Gbps/口)演进。换算成字节,NDR 400 Gbps 约合 50 GB/s 单向带宽。虽然绝对值低于 NVLink,但在网络层已属顶尖。
  • 内核旁路 RDMA:IB 支持 RDMA(Remote Direct Memory Access),允许一张 GPU 的显存直接读写另一台机器上 GPU 的显存,无需经过对方 CPU 和操作系统内核,将跨机通信延迟压到微秒级。
  • 网络级可靠性:原生支持自适应路由、拥塞控制、多路径传输,在千卡规模下仍能避免网络热点导致集体通信(Collective Communication)瘫痪。

在大模型场景中的定位

  • 数据并行(DP)与流水线并行(PP)的血管:3D 并行策略通常将 TP 限制在单节点内,而 PP 和 DP 的通信跨节点进行。PP 需要传输大量激活值,DP 需要周期性 AllReduce 梯度,两者都极度依赖 IB 带宽。
  • 决定集群线性扩展效率:在千卡集群中,如果 IB 网络出现收敛比不足或路由不均,NCCL AllReduce 速度会断崖式下跌,此时即使单卡算力再强,整体 MFU 也可能被拉到 30% 以下。

与 RoCE 的关系:InfiniBand 需要专用网卡(Mellanox ConnectX 系列)和专用交换机(如 QM9700/9790),成本高昂。第 19 章将详细讨论的 RoCE v2(RDMA over Converged Ethernet) 是在标准以太网上实现 RDMA 的替代方案,成本更低,但拥塞控制和稳定性略逊,通常在百卡至千卡级集群中作为 IB 的平替。


四、三级互联的带宽与定位对比

| 互联技术 | 典型带宽(单向) | 覆盖范围 | 核心作用 | 大模型典型场景 |
|---------|----------------|---------|---------|---------------|
| PCIe 4.0 x16 | ~32 GB/s | 主板总线 | CPU-GPU、外设通信 | 数据加载、单卡推理、边缘微调 |
| PCIe 5.0 x16 | ~64 GB/s | 主板总线 | CPU-GPU、外设通信 | 新一代平台数据通路 |
| NVLink 3.0 (A100) | ~300 GB/s 单向<br>(600 GB/s 双向) | 单机 8/16 卡全互联 | GPU 显存直连 | 机内张量并行(TP) |
| NVLink 4.0 (H100) | ~450 GB/s 单向<br>(900 GB/s 双向) | 单机 8/16 卡全互联 | GPU 显存直连 | 机内张量并行(TP) |
| InfiniBand HDR | ~25 GB/s<br>(200 Gbps) | 跨机集群 | RDMA 网络通信 | 机间数据并行、流水线并行 |
| InfiniBand NDR | ~50 GB/s<br>(400 Gbps) | 跨机集群 | RDMA 网络通信 | 大规模训练集群骨干网 |
| RoCE v2 | ~25–50 GB/s | 跨机集群 | 以太网 RDMA | 成本敏感型私有集群 |

:网络带宽通常以 Gbps(比特/秒)标称,总线带宽通常以 GB/s(字节/秒)标称,二者换算为 8:1。NVLink 带宽通常标称双向总和,IB 通常标称单向端口速率,上表为便于直观对比统一做了单向换算。


五、实用选型与工程认知

1. 单机训练必看 NVLink 拓扑
购买或租用 8 卡服务器时,不要只看“有没有 8 张 A100”,要看 NVSwitch 互联拓扑。主流 DGX/HGX 基板提供 8 卡全互联(任意两卡 NVLink 直连),但部分低价方案可能采用混合桥接拓扑,TP 效率会暗中打折。

2. TP 不跨机,DP/PP 不省网卡
工程铁律:张量并行(TP)尽量束缚在单机 NVLink 域内;流水线并行(PP)和数据并行(DP)跨机时,每张 GPU 至少配一张 HDR/NDR 网卡。千卡集群中,网卡与 GPU 的比例(通常 1:1 或 1:2)直接决定集群的线性扩展比。

3. PCIe 是隐形成本
很多开发者只盯着 GPU 和 IB,忽略了 CPU 与 GPU 之间的 PCIe 带宽。当数据加载或 Checkpoint 读写成为瓶颈时,升级 NVMe SSD 和确保足够 PCIe 通道数(避免与网卡抢带宽)同样关键。

4. 国产替代的现实
对于使用国产 GPU(如昇腾)的集群,需关注其自有互联方案(如昇腾 HCCS)与 IB/RoCE 的融合方式。通常在机内使用专有总线,机间仍走 IB/RoCE,逻辑与 NVIDIA 的 NVLink+IB 分层类似,但具体带宽和通信库性能需实测验证。


六、小结

GPU 互联技术是大模型分布式训练的“基础设施中的基础设施”:

  • PCIe 是通用底盘,负责 CPU-GPU 与外设通信,但带宽和拓扑限制使它难堪大模型分布式重用;
  • NVLink 是机内专用的超高带宽高速公路,让张量并行和低延迟 P2P 显存访问成为可能;
  • InfiniBand 是跨机 RDMA 网络,决定千卡集群能否实现接近线性的算力扩展。

三者缺一不可,共同构成了从单机到集群的完整通信体系。在 16.5 节中,我们将进一步探讨在显存和带宽约束下,如何通过量化、KV Cache 优化等手段“榨干”这些互联通道的每一滴价值。