人人都会AI编程

18.3 建设规模分级:几十卡级、百卡级、千卡级集群的设计差异

更新时间:2026-07-09

在 18.1 节完成算力测算、18.2 节明确集群定位(训练/推理/混合)之后,摆在建设方面前最现实的问题是:到底该买多少张卡?

行业习惯按 GPU 数量将算力中心划分为三个量级。需要特别提醒的是,这不是简单的线性堆叠——从几十卡扩展到千卡,面临的不是“多买几台服务器”的问题,而是网络架构、存储带宽、散热形态和运维体系的根本性重构。选错量级,轻则资源闲置,重则系统频繁崩溃、训练任务永远无法收敛。


一、几十卡级(8–64 卡):试验田与轻量生产

这是绝大多数企业第一次接触自建算力时的起点,也是风险最低、灵活性最高的形态。

典型场景

  • 7B–13B 模型的全参数微调(SFT)或 LoRA/QLoRA 适配;
  • 70B 模型的 INT4/INT8 推理服务;
  • 算法团队的技术验证(POC)与小规模业务上线。

硬件配置特征

  • 服务器:4–8 台 8 卡 GPU 服务器(常用 A800、H800、甚至 RTX 4090)。
  • 网络:单台内部 NVLink/NVSwitch 互联;多机之间通常采用 100 Gbps RoCE v2 或普通 25 Gbps/100 Gbps 以太网即可。不需要专用 InfiniBand 交换机。
  • 存储:单机本地 NVMe SSD 或一台 NFS 服务器就能满足,容量需求通常在 100 TB 以内。
  • 调度:Docker + Docker Compose,或轻量级 Kubernetes 即可。Slurm 在此规模下反而显得笨重。
  • 机房:标准风冷机柜,单机柜功率 8–15 kW,普通楼宇机房经简单改造即可承载。

成本区间:数百万到 1000 万元人民币。

真实陷阱

  • 消费级显卡的隐性成本:若使用 RTX 4090 等消费级卡,单卡算力虽强,但缺少 NVLink,多机通信只能走 PCIe 或以太网,70B 模型全参数微调时多机扩展效率可能暴跌至 60% 以下。
  • Checkpoint 孤岛:很多人把数据存在服务器本地盘,一旦节点损坏,数天的训练成果直接归零。几十卡级也必须配置 NAS 或对象存储做冗余备份。

二、百卡级(64–256 卡):业务落地的分水岭

当规模跨越 64 卡,集群从“实验室玩具”变成“生产系统”,网络、存储和调度三大瓶颈会同时爆发。百卡级是工程复杂度陡增的第一个拐点。

典型场景

  • 70B 模型的全参数微调与持续预训练;
  • 中等规模(如 30B–65B)基座模型的从头预训练;
  • 企业级多租户推理平台(同时服务多个业务线)。

硬件配置特征

  • 服务器:10–32 台 8 卡标准 GPU 服务器。
  • 网络必须引入高速网络。200 Gbps/400 Gbps 的 InfiniBand(HDR/NDR)或 RoCE v2 成为标配;网络拓扑从简单的 TOR(机柜顶交换机)升级为 Spine-Leaf(叶脊)两层架构(详见 19.2 节)。这是与几十卡级最本质的差异。
  • 存储:单机存储带宽根本喂不饱百卡并行读取,必须部署 并行文件系统(Lustre、GPFS 或 JuiceFS),存储节点与计算节点分离,聚合带宽需达到 50–100 GB/s,容量进入 PB 级。
  • 调度:需要专业的资源调度系统,如 Slurm(偏超算场景)或 Kubernetes + KubeRay(偏云原生场景),并引入队列管理、优先级抢占和资源隔离(详见 20.3 节)。
  • 机房:风冷仍是主流,但高密机柜(单柜 20–30 kW)开始需要行间空调或冷板液冷试点;供电需双路 UPS 保障。

成本区间:3000 万到 1 亿元人民币。

真实陷阱

  • 网络是阿克琉斯之踵:百卡级集群中,若网络规划不合理(如过度收敛比、跨机柜流量瓶颈),分布式训练的 MFU(模型算力利用率)可能从理想的 50% 直接掉到 20%,相当于一半的钱打了水漂。
  • 存储写爆:训练过程中频繁保存 Checkpoint(如每 100 步存一次),百卡同时写入会产生“IO 风暴”,极易冲垮底层存储。必须设计分层存储和异步缓冲机制。

三、千卡级(512–4096 卡+):基座模型的“重工业”

千卡集群已经不是普通企业的 IT 基建,而是国家战略级或头部科技公司层面的重资产投入。在这里,软件工程能力比硬件采购更重要——没有顶尖 Infra 团队,千卡集群只是一堆昂贵的废铁。

典型场景

  • 百亿至千亿参数基座模型的从头预训练;
  • 大规模 RLHF(人类反馈强化学习)和 Post-training;
  • 探索 GPT-4 级别模型的复现与迭代。

硬件配置特征

  • 服务器:128 台以上 8 卡服务器,通常统一选型 H100/H800 或国产等效芯片。
  • 网络网络投资占硬件总成本的 20%–30%。必须采用 InfiniBand NDR(400 Gbps) 或同等带宽的 RoCE v2,拓扑升级为 多轨道(Multi-Rail)Spine-Leaf 或胖树(Fat-Tree),确保任意两节点之间达到全带宽、无阻塞通信。网络延迟的微秒级抖动都会直接影响大规模 AllReduce 的效率。
  • 存储:多层次分级架构。热数据层(训练数据集、高频 Checkpoint)需要并行文件系统提供 TB/s 级聚合读写带宽,常配合 Burst Buffer(突发缓冲层)或专用 Checkpoint 存储池;温冷数据下沉至对象存储(如 Ceph、MinIO)。
  • 调度:超大规模 Slurm 集群,或自研调度平台,深度融合训练与推理的混部调度。核心设计目标从“资源分配”转向“故障容错”——必须支持Checkpoint 高频自动保存、故障节点自动隔离与任务弹性迁移(详见 21 章)。
  • 机房必须液冷。冷板式液冷成为千卡集群标配(部分前沿园区试点浸没式),单柜功率密度 40–80 kW;PUE(能源利用效率)需严格控制在 1.2 以下,往往需要在数据中心园区层面进行专门的供配电和散热设计。

成本区间:数亿到数十亿元人民币。

真实陷阱

  • 故障成为常态:千卡集群日故障率通常大于 1 台(硬盘、网卡、GPU HBM 纠错、光模块失效)。如果训练框架没有弹性 Checkpoint 和自动重启能力,一次为期两周的预训练任务可能永远无法跑完——因为故障总是在收敛前夜发生。
  • 散热即算力:一旦冷板流量不均或 CDU(冷量分配单元)故障,GPU 触发热保护降频,整集群算力瞬间打折。千卡集群的运维人员有一半精力在跟水冷管路和 PUE 打交道。

四、三规模核心差异对照表

| 维度 | 几十卡级(8–64) | 百卡级(64–256) | 千卡级(512+) |
|------|------------------|------------------|----------------|
| 核心用途 | POC、LoRA、中小推理 | 70B 微调、中等训练、企业推理平台 | 百亿/千亿基座预训练 |
| 网络 | 以太网/RoCE 100G | RoCE/IB 200G–400G Spine-Leaf | IB NDR 400G+ Multi-Rail |
| 存储 | NFS/本地 SSD | 并行文件系统(PB 级) | 分级存储+Burst Buffer(TB/s 带宽) |
| 调度 | Docker/K8s 轻量 | Slurm/K8s+队列隔离 | 超算级调度+故障自愈 |
| 散热 | 标准风冷 | 风冷+冷板试点 | 全局液冷(冷板式为主) |
| 单柜功率 | 8–15 kW | 15–30 kW | 40–80 kW |
| 建设成本 | 数百万–千万 | 数千万–亿级 | 数亿–十亿级 |
| Infra 团队 | 2–3 人 | 5–10 人 | 数十人(网络/存储/SRE) |
| 最大风险 | 缺乏备份 | 网络瓶颈、IO 风暴 | 日故障、散热崩溃、MFU 暴跌 |


五、选型箴言:不要为建设而建设

  1. 任务决定规模,而非预算决定规模。如果你的核心业务是 7B/13B 模型的行业微调,几十卡级集群完全够用;强行上千卡,只会导致显卡常年空转,折旧吞噬利润。
  2. 预留“物理接口”比一步到位更明智。如果未来可能从几十卡扩展到百卡,前期应预留机柜电力、高速网络端口和散热管路的冗余,避免后期推倒重来。
  3. 千卡是软件工程问题,不是采购问题。没有自研或深度定制的分布式训练框架、监控告警和故障自愈体系,千卡集群的 MFU 可能还不如一个调优后的百卡集群。

明确了规模分级后,下一步是 18.4 节的成本核算——不同规模背后,硬件、机房、能耗和运维的成本结构会发生怎样的质变?这将直接决定你的融资计划和 ROI 模型。