人人都会AI编程

16.3 主流 GPU 型号全解析

更新时间:2026-07-09

在 15.1 到 15.4 节中,我们搞懂了 GPU 的并行计算原理、Tensor Core 的作用以及显存带宽为何是瓶颈。但落到采购或租用算力时,你面对的不再是抽象的“计算单元”,而是具体的型号和报价单:3090 能不能训 7B 模型?A100 80G 是不是已经过时?H800 和 H100 到底差多少?国产卡能不能平替?

本节把当前大模型场景下最常被提及的 GPU 型号逐一拆解。先给一个总体原则:没有“最好”的 GPU,只有“最匹配你任务类型、集群规模和预算”的 GPU。


一、消费级:RTX 3090 / RTX 4090——个人开发者的“穷人的法拉利”

这两张卡是学界、独立开发者和极客团队最熟悉的“非正规军”装备。

| 核心参数 | RTX 3090 | RTX 4090 |
|---------|----------|----------|
| 架构 | Ampere | Ada Lovelace |
| 显存 | 24 GB GDDR6X | 24 GB GDDR6X |
| 显存带宽 | 936 GB/s | 1,008 GB/s |
| Tensor Core | 3 代 | 4 代(支持 FP8 稀疏加速)|
| NVLink | ❌ 无 | ❌ 无 |
| TDP | 350W | 450W |
| 当前市场定位 | 二手/存量主力 | 高端消费级新卡 |

适用场景

  • 本地推理与 Demo 验证:单卡 24G 显存配合 4-bit 量化(如 GPTQ、AWQ),可以本地跑通 Llama 3 8B、Qwen2-7B 全精度,或 70B 级模型的 INT4 量化版(需配合 CPU 卸载或分批加载,响应较慢)。
  • LoRA / QLoRA 微调:在 7B–13B 模型上做参数高效微调,消费级显存刚好够用。QLoRA 甚至允许在单张 4090 上微调 70B 模型(速度较慢,但可行)。
  • 小模型预训练:从零训练 1B 以下的小模型或领域词表。

真实局限性(避坑重点)

  1. 无 NVLink,多卡扩展性极差:PCIe 的带宽和延迟无法支撑高效的张量并行(TP)。8 张 4090 插在一起训 70B 模型,通信瓶颈会让 MFU(算力利用率)惨不忍睹,远不如同等数量的 A100。
  2. 显存容量天花板锁死 24G:32B 以上的全参数微调基本无缘,除非用极致的 ZeRO-Offload(把优化器状态卸载到内存/硬盘),但速度会慢到失去工程意义。
  3. 无 ECC 显存纠错:长时间高负载训练可能出现比特翻转导致的 Loss 飙升或静默错误,不适合严肃的生产级训练集群。
  4. 驱动与虚拟化限制:消费级驱动对虚拟化(SR-IOV)支持弱,云厂商很难像 A100 那样做多租户切片出租。

实用建议:如果你是一名独立开发者或高校科研人员,预算有限,只想做7B–13B 模型的微调、量化推理和 Prompt 工程,1–4 张 4090 是性价比最高的起点。但如果你是企业要做商业化的 70B 以上模型全参数训练或高并发推理服务,请直接跳过消费级。


二、数据中心级:A100、H100、A800、H800——训练集群的“正规军”

这四张卡是目前大模型训练与推理的绝对主力,但它们之间的代际差异和合规限制,经常被销售人员故意模糊。

核心参数对比

| 参数 | A100 (80G SXM) | H100 (80G SXM) | A800 (80G) | H800 (80G) |
|------|----------------|----------------|------------|------------|
| 架构 | Ampere | Hopper | Ampere(特供) | Hopper(特供)|
| 显存 | 80 GB HBM2e | 80 GB HBM3 | 80 GB HBM2e | 80 GB HBM3 |
| 显存带宽 | 2,039 GB/s | 3,350 GB/s | 2,039 GB/s | 3,350 GB/s |
| NVLink 带宽 | 600 GB/s | 900 GB/s | 400 GB/s | 400 GB/s |
| Tensor Core | 3 代 | 4 代 + Transformer Engine | 3 代 | 4 代 + Transformer Engine |
| FP16 算力 | 312 TFLOPS | 989 TFLOPS | 312 TFLOPS | 989 TFLOPS |
| FP8 支持 | ❌ | ✅ | ❌ | ✅ |
| 典型功耗 | 400W | 700W | 400W | 700W |
| 对华供应状态 | 禁售(存量流通) | 禁售 | 受限可售 | 受限可售(已进一步收紧) |

逐个型号定位

A100:上一代“老兵”,生态最成熟

  • 优点:CUDA 生态兼容性无可挑剔,无论是 PyTorch、DeepSpeed 还是 Megatron-LM,A100 都是默认优化目标。二手/租赁市场价格相对理性。
  • 缺点:算力密度已落后 H100 一代,尤其在 FP8 混合精度训练和 Transformer 类任务上差距明显。
  • 适合:预算有限的中小型训练集群、推理服务集群、教学与科研。

H100:当前训练性能的“天花板”

  • 核心杀手锏是 Transformer Engine:硬件级动态管理 FP8 精度,在 Transformer 训练任务上实测吞吐量可达 A100 的 2–3 倍。
  • 显存带宽和 NVLink 双提升,对 MoE 大模型和超长上下文训练极为关键。
  • 缺点:贵、缺货、功耗高(单卡 700W),对机房散热和供电密度提出更高要求。

A800 / H800:合规特供版,带宽剪刀差是隐患

  • 背景:受出口管制影响,NVIDIA 对华销售的 A100/H100 阉割版,核心算力未动,但 NVLink 互联带宽被大幅削减到 400 GB/s
  • 影响:单卡跑推理或微调,A800/H800 与原版几乎无差别;但在千卡级分布式训练中,卡间通信占比陡增,Scaling Efficiency(扩展效率)会明显低于原版集群。训练 GPT-4 级别的超大规模模型时,这种带宽剪刀差会被放大为时间和电费上的真金白银。
  • H800 后续进一步受到采购限制,实际流通价格往往高于海外原版 H100。

实用认知:如果你从云厂商租用“8 卡 A800”做 70B 模型训练,完全没问题;但如果你要建千卡集群做万亿参数 MoE 预训练,NVLink 带宽的削弱会让你的综合成本显著上升,必须提前做通信模拟和压力测试。


三、国产 GPU:昇腾、寒武纪、海光——合规背景下的“必答题”

在中美技术脱钩和信创政策驱动下,国产 GPU 已从“备胎”变成部分机构的“主胎”。但需要清醒认识:它们目前更适合“能用”,而非“好用”到无缝替换 CUDA。

华为昇腾(Ascend)910B:集群化最成熟的国产方案

  • 硬件规格:半精度算力约 320 TFLOPS(稠密),HBM 显存 32G/64G 版本,支持华为自研 HCCS 高速互联(对标 NVLink)。
  • 软件生态:CANN(异构计算架构)+ MindSpore(昇思)+ PyTorch 适配层。华为目前能提供从单卡到万卡集群的全套交付。
  • 真实体验
  • 如果你用 MindSpore + 昇腾原生算子,大模型训练已经能跑通,华为官方提供了 Llama、GPT 等模型的参考实现;
  • 如果你坚持用 PyTorch,需要通过 torch_npu 适配层迁移,部分自定义算子(尤其是最新的 MoE、注意力变体)需要手工编写 TBE 算子或等待社区支持,迁移成本客观存在
  • 千卡集群的线性加速比和故障率,与 NVIDIA 成熟方案相比仍有差距,需要更强的驻场工程团队兜底。
  • 适合:有政策合规硬性要求、具备华为技术栈维护能力的大型政企或运营商。

寒武纪(Cambricon)思元 370 / 590:推理强,训练追赶中

  • 现状:思元 370 在推理场景(INT8/INT4)性价比不错,已广泛部署于互联网推荐和 CV 推理;思元 590 面向训练,算力参数对标 A100,但显存和互联带宽略逊。
  • 生态:Cambricon Neuware 软件栈,PyTorch 迁移需要借助 MagicMind 转换工具。
  • 适合:以推理为主、训练为辅的混合负载,且对卡间互联要求不极端的场景。

海光 DCU:兼容 CUDA 的“曲线救国”

  • 技术路线:基于 ROCm 生态深度改造,对 CUDA 代码的兼容性在三者中最好。很多 PyTorch 程序只需少量修改甚至直接编译即可运行。
  • 现实差距:算力标称值不低,但实际利用率(尤其是小算子、复杂控制流场景)与 A100 仍有距离;显存带宽和通信库(RCCL vs NCCL)成熟度不足,大规模集群训练时容易遇到性能瓶颈。
  • 适合:已有大量 CUDA 代码资产、希望最小迁移成本切换到国产硬件的企业。

国产 GPU 的实用总结

| 维度 | 昇腾 910B | 寒武纪 590 | 海光 DCU |
|------|-----------|------------|----------|
| 单卡算力 | ★★★★ | ★★★ | ★★★ |
| 集群扩展 | ★★★★(万卡级) | ★★★ | ★★★ |
| 软件生态 | ★★★(MindSpore 强,PyTorch 弱) | ★★ | ★★★(兼容 CUDA 最好)|
| 迁移成本 | 中高 | 中 | 较低 |
| 典型场景 | 大模型预训练(信创) | 推理/边缘计算 | 科研/企业平滑迁移 |

一句话建议:国产 GPU 是政策驱动下的战略必选项,不是性能最优解。如果你团队没有专门的 AI Infra 工程师做适配和调优,贸然用国产卡做大模型预训练,项目延期风险极高。建议先从推理部署小模型微调切入,积累生态经验后再上训练集群。


四、选型决策框架:一张快速对照表

最后,给不同场景一个直观的选型指南:

| 你的场景 | 推荐选择 | 不推荐 | 原因 |
|---------|---------|--------|------|
| 个人学习 / 7B 模型本地玩 | RTX 4090 / 3090 | A100 | 性价比碾压 |
| 中小企业 13B–70B 微调 | 8× A100 80G(租赁) | 消费级 8 卡 | 显存够、生态稳 |
| 高并发推理服务(API) | H100 / A100 + TensorRT-LLM / vLLM | 国产卡(现阶段) | 吞吐与延迟要求极高 |
| 千卡级基座模型预训练 | H100 SXM 原版 / 昇腾 910B 万卡 | A800/H800(若可规避) | 互联带宽决定扩展效率 |
| 信创 / 政策合规硬性要求 | 昇腾 910B / 海光 DCU | NVIDIA 任何型号 | 合规优先 |
| 预算极紧的科研团队 | 二手 A100 40G / 3090 集群 | H100 | 算力够用即可 |


五、小结

  • 消费级(3090/4090):个人和小团队的“入场券”,但 24G 显存和无 NVLink 决定了它只能活在“小模型”和“验证”圈层。
  • 数据中心级(A100/H100/A800/H800):当前工程化的唯一成熟选择,其中 H100 是训练性能的绝对标杆,而 A800/H800 的互联带宽阉割是千卡训练时必须算清的账。
  • 国产 GPU:昇腾集群化最强但迁移成本高,海光兼容性最好但性能有折扣,寒武纪偏重推理。它们是合规与供应链安全的解,不是同价位性能的解。

在 16.4 节中,我们将进一步拆解 GPU 之间的互联技术——为什么 NVLink 比 PCIe 贵十倍,却仍然是大模型训练的必选项;以及 InfiniBand 网络在集群中扮演的角色。理解了“单卡性能”与“卡间通信”的乘积关系,你才能真正算清楚一套算力集群的 ROI。