7月21日,英伟达突然官宣Vera Rubin平台进入全球大规模部署。挑在AMD年度大会Advancing AI 2026开幕前一天发布,意图再明显不过——先把话筒抢走。
CoreWeave的测试数据被英伟达重点引用:Vera Rubin NVL72相比上一代Grace Blackwell NVL72,每兆瓦Token吞吐提升10倍。这不是"跑分好看",而是数据中心客户最敏感的指标:在电力和机柜空间固定的情况下,能产出多少AI服务。
换句话说,AI算力的竞争裁判,已经从"谁芯片更强"换成了"每度电能换多少Token"。
一、Vera Rubin 到底改了什么?
Vera Rubin不是一块GPU,而是一整套"AI工厂"生产线。
它把英伟达自研的Vera CPU、Rubin GPU、NVLink 6互联、ConnectX-9 SuperNIC、BlueField-4 DPU和Spectrum-6交换系统塞进一个整机架。按照英伟达的说法,这套系统已经部署到全球30多个国家的350多个节点,客户包括CoreWeave、谷歌云、微软Azure和甲骨文云。
这里有两个关键变化值得注意。
第一,英伟达自己做CPU了。 Vera是英伟达首款自研服务器CPU核心,不是以前那种基于ARM授权改出来的方案。它针对AI智能体工作负载优化,英伟达称在相关任务上比传统x86 CPU快约50%。这意味着英伟达不再满足于做"GPU供应商",而是要把CPU、GPU、网络、软件全包下来。
第二,整机架全液冷。 Vera Rubin全系没有散热风扇,冷却液温度可达45°C。对数据中心来说,风扇少了意味着噪音、故障点和维护成本都少了;液冷效率高了,才能在同样的电力配额里塞进更多算力。
二、为什么微软一边用Vera Rubin,一边把AMD整机架搬进Azure?
就在英伟达官宣的同一天,另一条新闻被很多人忽略了:微软Azure确认引入AMD的Helios整机架系统,含72颗MI455X GPU、2.9 exaFLOPS算力,并搭配第六代EPYC Venice处理器虚拟机。
有趣的是,AMD Helios机架报价比英伟达同类方案贵40%,微软还是下单了。原因很现实——没有任何一家云厂商愿意把命脉全押在英伟达身上。
2026年,英伟达在云端训练/推理AI加速器市场占51.7%,AMD是16.4%。但CUDA生态依然是英伟达的护城河,市占率92%。微软的"双供应商"策略,本质是在赌一个多极化的未来:硬件差距在缩小,软件生态的差距会被时间和投入慢慢磨平。
所以对英伟达来说,Vera Rubin的10倍提升不只是一次产品迭代,更是一次"先发制人"的防御——在AMD大会前把性能叙事钉死,让客户在对比时先有一个心理锚点。
三、算力中心的账,正在从"买卡"变成"买电"
如果你只关心大模型跑得快不快,可能会觉得这些硬件新闻很遥远。但它们正在决定你调用API时的价格和稳定性。
训练大模型需要大量GPU同时工作,推理则需要低延迟响应。两者共同点是:都极其耗电。一个十万卡级别的超集群,年耗电量可以轻松超过一座中小城市。当电力成为瓶颈,"每兆瓦产出多少Token"就成了比"单卡算力多少"更重要的经济指标。
这也是为什么国内厂商也在密集布局国产算力集群。中科曙光发布了全国产十万卡AI超集群"曙光8000",智谱被曝出已建成1GW级全国产芯片数据中心。当模型调用量上来之后,拥有自己的算力基础设施,不只是成本问题,更是可用性问题。
四、对普通人的两个实际影响
第一,API价格还会继续降,但降幅取决于电力和基础设施效率。 Token降价的尽头不是模型参数量,而是度电成本。谁能在同样的电费和机柜里产出更多Token,谁就有更大降价空间。
第二,AI服务的稳定性会越来越和能源、散热、网络绑定。 以后判断一家AI公司靠不靠谱,除了看模型榜单,还要看它有没有自己的算力节点、有没有液冷方案、能不能拿到电。
结语
英伟达和AMD的攻防,表面是芯片竞争,实际上是AI基础设施话语权的争夺。当算力从"稀缺商品"变成"工业原料”,决定胜负的就不再是某一张卡的跑分,而是谁能以更低的单位成本、更高的系统效率,把电变成Token。
这场战争的下半场,裁判是电费账单。