人人都会AI编程

谷歌砸了2000亿,却连模型前十都进不去:AI竞赛的门票,不是钱买的

更新时间:2026-07-23

7月21日深夜,谷歌DeepMind一口气发了三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。主打三件事:更省Token、更快速度、更低成本。

但所有人都在等的旗舰Gemini 3.5 Pro,依然没有出现。

这款原定6月发布的模型,已经跳票两个月。据10名谷歌现任和前任员工透露,跳票原因是编程能力达不到内部预期——而这恰恰是企业级AI最值钱的能力。消息传出当天,Alphabet股价单日下跌约4.4%,市值蒸发约2000亿美元。

跌出前十,不是差一点

Arena.ai前端代码竞技场最新榜单上,Gemini 3.6 Flash以1537分排在第12位。排在它前面的有:月之暗面Kimi K3(1677分,第一)、智谱GLM-5.2(第四),以及OpenAI和Anthropic的多款产品。

在Artificial Analysis智能指数排行榜上,谷歌没有任何一款模型进入前十。

去年11月,Gemini 3系列发布时一度让OpenAI内部拉响"红色警报"。八个月后,马斯克在X上发梗图调侃:xAI、OpenAI、Anthropic轮番发布"全球最强模型",终于轮到谷歌时,交出的却是几款主打省钱的Flash模型。

钱最多的玩家,为什么打不赢?

谷歌不缺钱。二季度财报显示,Alphabet营收1198亿美元,同比增长24%;云业务收入同比增长82%至248亿美元;Gemini月活用户9.5亿。2026年全年资本开支指引上调至1950亿至2050亿美元——这可能是人类历史上单一企业在AI基础设施上最大的一笔投入。

但模型排行榜不看预算表。三个结构性问题正在拖住谷歌。

组织复杂性

谷歌需要在模型发布前协调搜索、地图、YouTube等多个产品线的利益相关方。模型要服务的不只是开发者,还有整个谷歌产品体系。每一道发布决策都要过更多道关,而Anthropic和月之暗面没有这个包袱。

训练数据更新失败

6月下旬,团队尝试通过更新训练数据集来改进3.5 Pro的编程能力,结果令人失望。这不是算力不够——谷歌的TPU集群可能是全球最大的——而是数据工程和训练方法的问题。

产品绑定的双刃剑

9.5亿月活是护城河,也是枷锁。模型必须在搜索、地图、YouTube等场景中表现稳定,不能为了刷榜牺牲产品体验。创业公司可以全力以赴冲模型能力,谷歌不行。

对开发者的三条启示

别赌单一厂商的旗舰

谷歌旗舰跳票两个月,OpenAI的GPT-5.6分三档发布,Anthropic的Fable 5刚转计量计费。每家的路线图都在变。把你的Agent架构做成模型可插拔的——qwen-code、OpenOcta这些开源框架已经证明了这条路可行。

盯排行榜,但别跟着排行榜选模型

Kimi K3比Gemini 3.6 Flash高140分,但真正决定开发体验的是上下文工程、工具调用稳定性和成本控制,不是那140分。头部模型能力已经高度趋同,工程能力才是差异化。

把"省Token"当能力,不是退而求其次

谷歌这次发的3.6 Flash,Token消耗比上一代减少17%,部分工程任务最多减少65%。在Token价格持续下探但企业账单仍在膨胀的当下,能帮你省Token的模型,比最贵的那款更值钱。

Gemini 4已经在路上了

皮查伊在财报电话会上透露,谷歌已启动"迄今最具雄心的Gemini 4预训练工作"。但2026年的AI竞赛已经证明一件事:钱多不等于模型强,用户多不等于产品好,资本开支大不等于能赢。

谷歌的2000亿蒸发和跌出前十,给所有押注AI的开发者提了个醒——这场仗的门票,不是钱买的。