过去两年,判断一家 AI 公司算力实力的标准很简单:你有多少张卡?万卡是门槛,十万卡是天花板。
但在 2026 世界人工智能大会(WAIC 2026)上,这个问题已经没人问了。展厅 C 位不再是某个"模型之王"的演示台,而是华为昇腾 950 超节点真机——1024 张 NPU 卡塞进一组黑色机柜,宣称"像一台计算机一样工作"。旁边,中科曙光亮出全国产十万卡超集群曙光 8000(登峰),沐曦发布曦景 S600 超节点,燧原科技首发云燧 ESL64-O 超节点,中兴推出 OEX 超节点。
所有人比的不再是卡的数量,而是系统。
从"单卡比拼"到"系统级较量"
算力竞赛的逻辑变了。过去拼的是单张 GPU 的峰值算力——谁家的 TFLOPS 数字更大,谁就赢。但现在万亿参数模型训练需要成百上千张卡并行协作,推理需要毫秒级响应。一张卡再快,如果和其余卡的通信延迟过高,整体效率反而会暴跌。
华为昇腾 950 超节点给出的答案很直接:1024 张卡通过灵衢互联协议高速连接,实现 256TB 跨物理节点统一内存编址,RTT 时延控制在 3 微秒以内。翻译成人话——这 1024 张卡共享一块内存,互相通信比眨眼还快。
曙光 8000 的设计思路更有代表性:采用"超智融合"架构,不做传统分区,让高精度科学计算和低精度 AI 训练推理在同一套系统里原生运行。你不需要在两套集群之间来回搬数据。
裁判换了:从峰值算力到 Token 成本
一位算力服务商在现场说了一句很实在的话:"过去大家问的是'你们有多少张卡',现在问的是'Token 成本多少,响应时延多长'。"
这背后是 AI 应用重心的迁移。大模型训练高峰之后,行业焦点转向推理落地和 Agent 应用。训练是一次性重投入,推理是持续性运营支出——单位 Token 成本决定商业模型能否跑通。
燧原科技 CEO 赵立东判断:推理算力需求将达到训练的 10 倍甚至 100 倍。训练追求极致算力,推理追求极致性价比。
华为公布的数据印证了这个方向:昇腾超节点在低时延推理场景中单卡性能相比传统服务器提升 3 倍,推理成本大幅下降。
十万卡的真正门槛:不是芯片,是系统
中科曙光高级副总裁李斌说得直白:"十万卡考验的不是卡的数量,而是系统架构、网络互连、访存效率、能效控制,以及生态应用能力的综合较量。"
简单堆卡会遇到"线性加速比"困境——理论上 10 万卡应该比 1 万卡快 10 倍,实际往往只快了 3-4 倍。网络延迟、数据同步、能耗瓶颈会把效率拉下来。
曙光 8000 证明了国产系统在十万卡规模下还能保持高并发和高吞吐的稳定性。这意味着中国 AI 基础设施已经从追求理论峰值的初级阶段,进入追求实际应用效率的高级阶段。
大湾区韶关的万卡集群同样值得关注:30 个昇腾 910C 超节点,9000P 统一智算资源池,全程液冷散热,90 天建成上线,工期比行业标准缩短 50%。它承载万亿参数国产大模型训练任务,目标是芯片到模型的全栈国产化。
Token 更便宜,用量反而更大
算力换了赛道,对开发者和使用者的直接影响是:AI 服务更便宜、更稳定。
DeepSeek V4-Pro 每百万 Token 输入仅 0.025 元,OpenAI GPT-5.6 推出三级定价,Terra 模型价格直接腰斩,Meta Muse Spark 1.1 的 API 定价仅为头部模型的 25%。支撑这些降价的正是超节点和超集群带来的推理效率提升。
但杰文斯悖论在生效:Token 更便宜了,用量反而更大。2026 年二季度平台 Token 周调用量从 21 万亿飙升至 46 万亿,翻了一倍。企业把 AI 塞进每一个业务流程,几毛钱的 Agent 任务取代了人工两小时的工作。
算力竞赛的结果不是谁卡多谁赢,而是谁的系统更高效、谁的 Token 更便宜、谁的推理更稳定——这场系统级较量,才刚刚开始。