人人都会AI编程

16.2 训练与推理对 GPU 的不同需求差异

更新时间:2026-07-09

在 16.1 节中,我们分析了训练大模型时面临的三大硬件瓶颈——计算瓶颈、显存瓶颈与通信瓶颈。但当你把训练好的模型部署到线上、开始面向真实用户提供服务时,会发现这些瓶颈的权重发生了剧烈变化:训练是“冲刺”,推理是“长跑”;训练要“算得深”,推理要“回得快”。如果你用训练的思维去采购推理卡,或者用推理的机器去跑训练,预算和体验都会双输。

本节把训练与推理对 GPU 的需求拆成六个维度对比,帮你在选型时建立清晰的硬件画像。


一、核心差异速查表

| 维度 | 训练(Training) | 推理(Inference) |
|------|------------------|-------------------|
| 计算目标 | 更新权重(反向传播) | 前向计算生成 Token |
| 并行模式 | 数据并行 + 张量/流水线并行 | 单卡或多卡张量并行,侧重 batch 内并行 |
| 显存占用 | 参数 + 优化器状态 + 梯度(极大) | 参数 + KV Cache + 少量激活(相对可控) |
| 显存带宽 | 高需求,但计算通常是首要瓶颈 | 极度敏感,直接决定首 token / 后续 token 延迟 |
| 互联带宽 | 刚需,NVLink/IB 决定扩展效率 | 中等需求,单卡或 PCIe 可满足多数场景 |
| 精度要求 | FP16/BF16 + FP32 主权重 | 可接受 INT8/INT4/FP16,量化收益巨大 |
| 延迟敏感度 | 不敏感(关注整体吞吐与收敛) | 极度敏感(首 token TTFT、生成间隔 TPOT) |
| 故障容忍 | 低(断点需回滚, checkpoint 频繁) | 高(单卡故障可切流量,秒级恢复即可) |


二、计算模式:反向传播的“重”与前向生成的“轻”

训练阶段,GPU 需要同时执行前向传播(Forward)和反向传播(Backward)。反向传播涉及梯度计算与参数更新,计算量约为前向的 2–3 倍。因此训练对 FP16/BF16 Tensor Core 的密集算力(TFLOPS) 要求极高,且需要持续的计算吞吐量。

推理阶段,只有前向传播。但这里有一个关键细节:自回归生成的每个 step 都在重复读取全量参数,却只产生一个(或少量)新 token。这使得推理的计算强度(Arithmetic Intensity)远低于训练。换句话说,GPU 的 Tensor Core 经常处于“等数据”的状态,显存带宽反而成为瓶颈。

实用认知:训练卡追求峰值算力(如 H100 的 989 TFLOPS FP8),而推理卡更追求算力与显存带宽的平衡,甚至刻意强化带宽(如 L40S、L4 这类 Ada Lovelace 架构卡在推理场景性价比极高)。


三、显存容量:训练是“贪吃蛇”,推理是“精打细算”

训练时的显存开销(以 AdamW 优化器为例):

  • 模型参数(FP16/BF16):2 Bytes / 参数
  • 优化器状态(FP32 动量 + 二阶矩):8 Bytes / 参数
  • 梯度(FP16):2 Bytes / 参数
  • 激活值(与序列长度、Batch Size 正相关)

合计下来,一个 7B 模型全参数训练,单卡显存轻松突破 80 GB,必须借助 ZeRO、Offloading 或 3D 并行(见第 9 章)。这也是为什么训练几乎 exclusive 使用 A100/H100 这类大显存 HBM 卡。

推理时的显存开销

  • 模型参数(经量化后更小)
  • KV Cache(见 22.3 节):服务并发用户时,每个序列的历史 Key/Value 需常驻显存,长上下文下 KV Cache 甚至超过参数本身
  • 激活值(极小)

因此,推理显存需求随 并发数 × 序列长度 线性膨胀,而非随模型大小固定膨胀。一个 70B 模型 INT4 量化后仅约 40 GB,但如果你有 100 个并发用户、每轮 8K 上下文,KV Cache 可能吃掉数百 GB。

实用认知

  • 训练集群必须单卡大显存(80 GB HBM 起步);
  • 推理集群可通过多卡负载均衡分页注意力(PagedAttention,见 17.3 节)缓解显存压力,不一定需要顶级训练卡。

四、显存带宽:推理的隐形天花板

这是最容易被低估的差异。

训练时,数据以较大 Batch 连续流入,计算密度高,HBM 带宽(如 A100 的 1.5–2.0 TB/s)与计算单元配合相对均衡。

推理时,尤其是低并发或单用户场景,GPU 频繁执行“读取全量权重 → 计算一个 token → 写回 KV Cache”的循环。此时,每生成一个 token 都需要把整份模型权重从 HBM 搬到计算单元。显存带宽直接决定了你能多快完成这一搬运动作。

用一个粗糙的工程公式体会:

推理吞吐(tokens/s)∝ 显存带宽(GB/s) / 模型权重(GB)

这意味着:

  • 同样是 70B 模型 FP16(140 GB),在 A100(带宽 2 TB/s)上的理论上限,远高于 RTX 4090(带宽 1 TB/s)。
  • 如果做 INT4 量化(35 GB),4090 的性价比可能反超,因为带宽压力减半,而它的算力并不弱。

实用认知:大规模推理部署时,显存带宽 per 美元 是比峰值算力更重要的指标。


五、互联与通信:训练“离不开”,推理“看情况”

训练必须高强度互联

  • 数据并行需要 AllReduce 同步梯度;
  • 张量并行需要每层的激活值在卡间高速交换;
  • 没有 NVLink(900 GB/s)或 InfiniBand,多卡扩展效率会断崖式下跌(见 9.7 节、16.4 节)。

推理的通信需求分层

  • 单卡推理:不需要卡间通信,一张 RTX 4090 或 L4 就能跑,成本极低。
  • 单节点多卡推理(张量并行):需要 NVLink 或至少 PCIe 4.0/5.0,但通信量远低于训练,因为只传激活值,不传梯度。
  • 多节点推理:仅在超大模型(如 400B+)或超长上下文batch过大时才需要,通常可用 RoCE 甚至高速以太网凑合。

实用认知:训练集群的网络投资(InfiniBand 交换机、光模块)可能占整机成本的 30% 以上;而推理集群可以大幅削减网络预算,把 money 花在多买 GPU 和 SSD 上。


六、精度容忍:训练求稳,推理求快

训练对精度敏感。FP16 的梯度下溢、BF16 的数值稳定性差异,都会直接影响模型收敛。训练通常采用 BF16/FP16 混合精度,并保留 FP32 主权重(AdamW 的 32-bit 状态)。

推理对精度极度宽容。INT8、INT4、GPTQ、AWQ 等量化方案(见 22.2 节)在推理端几乎成为标配:

  • INT8 通常带来 30–50% 吞吐提升,精度损失 < 1%;
  • INT4 可实现 2–3 倍吞吐,对生成类任务主观体验影响极小;
  • 部分场景甚至使用 FP8/INT4 混合,或 SmoothQuant 等逐层校准策略。

这意味着训练和推理可以使用完全不同的硬件代际。用 H100 训练出来的模型,完全可以量化后部署在 T4、L4 甚至 Jetson 边缘设备上。


七、延迟 vs. 吞吐:两个不可兼得的优化方向

训练只关心吞吐(Throughput)

  • 单位时间内处理多少样本;
  • 多久能跑完一个 epoch;
  • 延迟不重要,哪怕一个 step 花 10 秒,只要 GPU 利用率(MFU)高就行。

推理需要同时平衡两个指标

  1. TTFT(Time To First Token):用户发送 prompt 后,多久看到第一个字?这取决于 prompt 的预填充(Prefill)阶段算力。
  2. TPOT(Time Per Output Token):生成阶段每个新 token 的间隔。这取决于解码阶段的带宽和批处理效率。

为优化 TTFT,需要高算力做并行预填充;为优化 TPOT,需要高带宽和低量化精度做快速解码。为优化整体吞吐,又需要把多个用户请求拼成 Continuous Batching(连续批处理,见 22.3 节),这会牺牲单用户延迟。

实用认知:对话类应用(如客服)对 TPOT 敏感,要求 < 50ms/token;离线批处理(如生成报告)只关心总吞吐,可以用高 batch 压满 GPU。你的 GPU 选型和服务框架(vLLM/TGI,见 23 章)必须匹配这个 SLA。


八、故障容忍与稳定性:训练“零容忍”,推理“可降级”

训练任务一旦中断,当前 step 的梯度状态丢失,必须从最近的 checkpoint 恢复。千卡集群中,单卡显存报错、网络闪断、NCCL timeout 都是灾难。因此训练 GPU 需要 ECC 显存纠错、RAS 特性、严格的温度与功耗墙控制(A100/H100 的数据中心级设计)。

推理服务天然可容错

  • 单卡宕机,负载均衡器把流量切到其他副本即可;
  • 不需要 checkpoint 机制;
  • 消费级卡(如 RTX 4090)没有 ECC,在推理场景中长期运行虽偶发显存软错误,但通常只影响单条请求,可接受。

这也是为何推理集群可以大胆采用消费级 GPU 或游戏卡改造方案,而训练集群必须坚持数据中心级硬件。


九、实战选型建议

| 场景 | 推荐 GPU 类型 | 关键考量 |
|------|---------------|----------|
| 预训练 / 全参数微调 | A100/H100/H800,80GB HBM | 大显存、NVLink、IB 网络、ECC |
| RLHF / DPO 对齐训练 | A100/H100 | 显存容量 > 纯算力,因需加载奖励模型 + 策略模型 |
| 高并发在线推理 API | H100/L40S/L4,或 T4 集群 | 带宽、INT8/INT4 Tensor Core、功耗比 |
| 私有化本地部署(低并发) | RTX 4090/3090,A6000 | 显存容量/价格比极高,无 NVLink 也可接受 |
| 边缘 / 端侧推理 | Jetson、昇腾 310/910B、Apple M 系列 | 极致低功耗,配合 INT4/AWQ 量化 |


十、小结

训练与推理对 GPU 的需求差异,本质上是“计算密集”与“内存带宽密集”的差异,是“离线批处理”与“在线交互服务”的差异,也是“必须精确可复现”与“可接受近似加速”的差异。

关键 takeaway:

  • 训练卡看显存、看互联、看 FP16/BF16 算力稳定性
  • 推理卡看带宽、看量化支持、看延迟与并发平衡
  • 同一张卡(如 A100)既能训练也能推理,但最优解往往是“训推分离”:用 H100 集群炼模型,用 L4/L40S 集群或量化后的 4090 阵列做服务,TCO(总体拥有成本)最低。

在 16.3 节中,我们将具体拆解市面上主流 GPU 型号的参数与定位——看完本节,你就能明白为什么 RTX 4090 是推理性价比之王,而 H100 是训练集群的硬通货。