在 18.1 节和 18.2 节中,我们完成了算力需求的测算与集群定位。现在进入真正的硬件落地环节:当你把一台 GPU 服务器(GPU Server / AI Server)放进机柜时,它绝不只是“一台普通服务器插了几张显卡”。大模型训练对数据搬运、参数同步、检查点写入的吞吐量要求极为苛刻,CPU、内存、硬盘、网卡任何一个环节出现短板,都会导致昂贵的 GPU 空转。本节给出工程界经过大量项目验证的选型标准与配比公式。
一、总体设计原则:以 GPU 为中心,消除一切 I/O 瓶颈
GPU 服务器的设计逻辑与普通 Web 服务器或虚拟化服务器完全不同。核心原则只有一条:让 GPU 在 100% 的时间内都有数据可算,有网络可通,有硬盘可写。
这意味着:
- CPU 不是算力主角,而是“数据搬运工”和“任务调度员”;
- 内存 是 CPU 与 GPU 之间的缓冲带,容量必须能吞下整个数据加载管线;
- 本地硬盘 是分布式存储的“一级缓存”,Checkpoint 写入速度直接决定故障恢复时间;
- 网卡 是集群的血脉,参数同步慢了,GPU 就集体idle。
二、CPU 选型:通道数与核心数比主频更重要
2.1 选型核心指标
| 指标 | 要求 | 原因 |
|------|------|------|
| PCIe 通道数 | 单 CPU ≥ 64 条 PCIe 4.0/5.0 通道 | 保障 8 张 GPU 全速互联(x16)+ NVMe SSD + 网卡不打架 |
| 核心数 | 单颗 ≥ 32 核,双路总计 ≥ 64 核 | 数据预处理、数据加载(DataLoader)、通信后台线程极度吃 CPU |
| 内存通道数 | 单 CPU ≥ 8 通道 DDR4/DDR5 | 决定系统内存带宽,影响 CPU-GPU 数据搬运 |
| AVX-512/AMX | 支持向量/矩阵加速指令集 | 部分框架的 CPU Offload、量化算子会用到 |
2.2 Intel vs AMD 的务实选择
- Intel Xeon Scalable(第四代/第五代):单核性能略强,部分 AI 框架(尤其是早期 CUDA 生态配套工具)兼容性更好。典型型号:Platinum 8480+、Gold 6430 等。缺点是 PCIe 通道数相对保守(单路 80 条左右),大模型场景通常必须上双路才能喂饱 8 卡。
- AMD EPYC(9004/9005 系列):单颗 CPU 即可提供 128 条 PCIe 5.0 通道,且核心数更高(96 核/128 核),在多 GPU 直通场景下扩展性更好。部分国产 GPU 服务器平台也优先适配 EPYC。缺点是某些特定库(如部分版本 NCCL 插件或 Intel 系编译优化)可能需要额外验证。
工程共识:训练集群选 AMD EPYC 的趋势越来越明显,因为“通道数即正义”;推理集群若涉及较多传统业务逻辑,Intel 的兼容生态更省心。
2.3 CPU 与 GPU 的数量配比
- 大模型预训练:1 颗 CPU 对应 2–4 张 GPU(即 8 卡服务器配双路高核心 CPU)。数据加载、Checkpoint 序列化、通信后台线程极其繁忙,CPU 太弱会成为“ GPU 饥饿”的直接原因。
- 推理/微调:可放宽至 1 颗 CPU 对应 4–8 张 GPU,甚至采用单路 CPU 配 4 卡方案以降低成本。
血泪教训:曾有项目为省钱给 8×A100 服务器配了单路 16 核 CPU,结果 DataLoader 预处理跟不上,GPU 利用率(MFU)长期低于 30%。
三、内存选型:容量第一,频率第二
3.1 容量配比公式
系统内存(RAM)不是给模型参数住的(参数住 GPU 显存),而是给以下对象住的:
- 数据预加载缓冲区
- Python 进程、框架运行时
- CPU 端的数据增强与格式转换
- GPU Direct Storage / RDMA 的缓冲
经验公式:
系统内存容量 ≥ 单张 GPU 显存容量 × GPU 数量 × (1~2 倍)
| GPU 配置 | 建议系统内存 | 说明 |
|---------|-------------|------|
| 8×A100 40GB | 512 GB – 1 TB | 基础训练场景 |
| 8×A100 80GB | 1 TB – 2 TB | 大 Batch 或 CPU Offload 场景 |
| 8×H100 80GB | 1 TB – 2 TB | 标配,H100 算力更高,数据吞吐需求更大 |
| 8×H800 / H100 NVL | 2 TB+ | 超大规模预训练节点 |
3.2 类型与通道
- DDR4 vs DDR5:新平台优先 DDR5-4800,带宽提升明显;存量平台 DDR4-3200 仍可接受。
- RDIMM vs LRDIMM:常规训练节点 RDIMM 即可;若单台需要插满 2TB 以上且主板槽位有限,考虑 LRDIMM(减载 DIMM)以提升容量上限,但会略微增加延迟。
- 配置原则:务必插满所有内存通道(Balanced Configuration),不要让通道空置,否则内存带宽直接打折。
四、硬盘选型:三层分级,NVMe 是底线
大模型场景的硬盘不是“装系统”那么简单,它要承载:
- 操作系统与基础环境
- 海量训练数据的本地缓存(来自分布式存储或对象存储)
- 高频次的 Checkpoint(GB 级到 TB 级)写入
4.1 三层存储配置标准
| 层级 | 用途 | 介质与规格 | 容量建议 |
|------|------|-----------|---------|
| 系统盘 | OS、CUDA、Docker、基础镜像 | 2× 480GB/960GB SATA/SAS SSD(RAID 1) | 960 GB 足够 |
| 本地数据盘 | 训练数据集缓存、中间文件 | 4×/8× 3.84TB/7.68TB NVMe U.2/U.3 SSD | 15 TB – 60 TB |
| Checkpoint 高速盘 | 模型检查点高频写入 | 可选 2× 3.84TB NVMe(RAID 0 或独立)或直连 NVMe | 与单卡显存总量匹配 |
4.2 关键工程细节
- NVMe 是底线:训练节点禁止使用 SATA SSD 或机械盘做数据缓存。假设你每 10 分钟写一个 100GB 的 Checkpoint,SATA SSD 的 500MB/s 写入会让你写 3 分钟以上,期间 GPU 可能阻塞等待;而 NVMe SSD(3–7GB/s)可将时间压缩到秒级。
- 热插拔(Hot-swap):选择前置热插拔 U.2 硬盘位的机箱。数据工程师经常需要更换数据集或紧急扩容,热插拔能避免整机下电。
- RAID 策略:系统盘 RAID 1 保平安;数据盘不建议组 RAID 5/6(重建慢且消耗 CPU),通常直接单盘裸挂或多盘独立挂载,由上层软件(如 JuiceFS、本地缓存层)做冗余。
- 寿命(DWPD):Checkpoint 持续写入非常耗盘。建议选择企业级 NVMe,DWPD(每日全盘写入次数)≥ 1,或预留 20% 的 OP(Over-Provisioning)空间以延长寿命。
五、网卡选型:三张网,千万不能混
GPU 服务器通常需要三类网络接入,它们的物理网卡必须分离,否则带宽抢占会导致训练中断或存储卡顿。
5.1 三张网的定义与配置
| 网络类型 | 用途 | 网卡规格 | 接口类型 |
|---------|------|---------|---------|
| 管理网(BMC + 业务管理) | IPMI/iKVM、SSH、日志、监控 | 双口 1GbE 或 10GbE | RJ45 |
| 存储网 | 连接并行文件系统或对象存储 | 单/双口 25GbE/100GbE RoCE 或 TCP | SFP28/QSFP28 |
| 计算网(RDMA 网络) | GPU 之间参数同步、集合通信 | 单口/双口 200G/400G NDR InfiniBand 或 200G RoCE v2 | QSFP56/QSFP112 |
5.2 关键注意事项
- 计算网必须用 RDMA:大模型训练的 AllReduce 通信量极大。若走传统 TCP/IP,网络延迟和 CPU 开销会让分布式训练崩溃。无论是 InfiniBand(Mellanox/NVIDIA ConnectX-7)还是 RoCE,RDMA 是刚需(详见 19.2 节)。
- 网卡与 GPU 的 NUMA 亲和性:多路 CPU 服务器中,网卡应插在离 GPU 更近的 CPU 的 PCIe Root Complex 下,避免跨 NUMA 节点访问带来的延迟惩罚。
- 多网卡绑定:存储网若采用双 100GbE,可用链路聚合提升带宽;计算网通常单张 200G/400G 已足够单节点,超大规模集群再考虑双端口。
- 国产替代现状:若使用昇腾等国产 GPU,需配套其自研的 HCCS/RoCE 网卡或专用交换网络,与 NVIDIA 的 IB 生态不兼容,需在立项阶段就确定网络路线。
六、典型配置模板(可直接参考)
模板 A:大模型预训练节点(旗舰型)
| 组件 | 配置 |
|------|------|
| GPU | 8× NVIDIA H100 80GB SXM5 |
| CPU | 2× AMD EPYC 9654(96C,192T)或 Intel Platinum 8490H |
| 内存 | 2TB DDR5-4800 RDIMM(16×128GB) |
| 系统盘 | 2× 960GB SATA SSD(RAID 1) |
| 本地数据盘 | 8× 7.68TB NVMe U.2 SSD |
| 计算网 | 1–2× Mellanox ConnectX-7 NDR 400G IB |
| 存储网 | 2× 100GbE RoCE |
| 管理网 | 2× 1GbE(含 BMC) |
模板 B:推理/微调节点(均衡型)
| 组件 | 配置 |
|------|------|
| GPU | 8× NVIDIA A100 40GB PCIe |
| CPU | 2× Intel Xeon Gold 6430(32C)或 AMD EPYC 9354 |
| 内存 | 512GB–1TB DDR4-3200 |
| 系统盘 | 2× 480GB SATA SSD(RAID 1) |
| 本地数据盘 | 4× 3.84TB NVMe U.2 |
| 计算网 | 1× NDR200 IB 或 2× 100GbE RoCE |
| 存储网 | 2× 25GbE |
模板 C:国产算力节点(昇腾场景)
| 组件 | 配置 |
|------|------|
| NPU | 8× 昇腾 910B 64GB |
| CPU | 2× 鲲鹏 920(或海光 C86,需确认 PCIe 拓扑) |
| 内存 | 1TB–2TB DDR4 RDIMM |
| 本地盘 | 8× NVMe SSD(需确认国产服务器背板支持) |
| 网络 | 华为自研 HCCS + RoCE,或 CE 系列交换机 |
| 注意 | 需使用 CANN + MindSpore/PyTorch 适配版本 |
七、五大常见踩坑点
- CPU 配太弱,GPU 吃不饱:8 卡服务器配单路 16 核 CPU,DataLoader 进程无法及时解码和送数据,GPU 利用率长期在 20%–40%。
- 内存插不满通道:只插了一半内存槽,内存带宽减半,CPU-GPU 数据搬运成为瓶颈。
- 用 SATA SSD 代替 NVMe:Checkpoint 写入慢,导致训练每存一次点就要卡顿数分钟,严重拖垮有效训练时间。
- 三张网物理混用:把存储流量和计算流量跑在同一张网卡上,AllReduce 时存储 I/O 被挤爆, vice versa。
- 忽视 PCIe 拓扑:网卡或 NVMe 盘挂在错误的 CPU Root Complex 下,跨 NUMA 通信,RDMA 延迟飙升。
八、小结
GPU 服务器的选型本质是围绕 GPU 的 I/O 平衡设计:
- CPU:重通道、重核心,轻单核频率;预训练节点建议双路高规格。
- 内存:容量按显存总量的 1–2 倍配置,务必插满通道。
- 硬盘:系统盘 RAID 1 保平安;数据与 Checkpoint 盘必须企业级 NVMe,容量按单机数据集缓存需求设计。
- 网卡:管理、存储、计算三网物理分离;计算网必须上 RDMA(IB 或 RoCE),200G 起步。
在 19.2 节中,我们将进一步放大视野,从单机走向集群,详解三网分离的架构设计、InfiniBand 与 RoCE 的选型,以及 Spine-Leaf 网络拓扑如何支撑千卡级训练的通信需求。