人人都会AI编程

GPT 5.6三档围剿Fable 5,ChatGPT Work上位:开发者该重新算账了

更新时间:2026-07-21

7月9日,OpenAI一口气做了三件事:把GPT-5.6三档模型(Sol、Terra、Luna)转为正式可用,发布"超级应用"ChatGPT Work,把Codex和Atlas浏览器收进同一个桌面入口。同一天,Anthropic的Claude Fable 5刚从19天的出口管制停服里缓过来不到一周。这不是巧合,是围剿。

Fable 5的困境:最强,但贵且孤立

先说实力。6月9日发布时,Fable 5在SWE-bench Pro拿到80.3%,是所有公开模型里最高的;FrontierCode Diamond 29.3%,是Opus 4.8的两倍多;Terminal-Bench 2.1有88.0%。Stripe用它一天干完了一个5000万行Ruby代码库的迁移,手动做要两个月。能力没问题。

问题在另外三件事上。第一,价格。Fable 5定价输入10美元、输出50美元每百万Token,是Opus 4.8的两倍,也是目前公开前沿模型里最贵的。第二,6月12日它因为美国政府出口管制指令被全球停服19天,7月1日才恢复——一个能被随时拔电的旗舰,对企业采购来说是硬伤。第三,也是最狠的:6月23日起Fable 5从Pro、Max订阅计划里移出,想继续用得额外买credits按API费率结算,同时所有流量强制留存30天。Anthropic刚向SEC秘密提交IPO招股书,估值9650亿美元,它需要把高价值用户从固定月费推向按量计费来证明定价权。

一句话:能力天花板在Anthropic手里,但成本地板在别人手里。

GPT-5.6的三档围剿

OpenAI的打法是"一桌菜,三个价位"。Sol是旗舰,$5/$30,正好是Fable 5的一半;Terra $2.50/$15;Luna $1/$6。关键不是Sol——是Terra和Luna越级打人。OpenAI公布的数据:Terra和Luna的代码能力都超过Fable 5,但成本只有后者的约1/16。在Agents' Last Exam(覆盖55个专业领域的长周期工作流测试)里,Sol拿53.6分,比Fable 5高13.1分,预估成本却只有四分之一。在Artificial Analysis Intelligence Index v4.1上,Sol和Fable 5的差距缩到1分以内,但完成任务的时间少61%、成本约一半。

这意味着什么?过去你选模型是在"最强"和"够用"之间二选一,现在OpenAI用三个价位把Fable 5夹在中间:要跑分有Sol,要性价比有Terra和Luna,而且后者还更便宜。Fable 5唯一的护城河是SWE-bench Pro那个80.3%——但这是Anthropic自家跑分,独立评测还没铺开。

GPT-5.6还带了一个对开发者更实际的东西:程序化工具调用(Programmatic Tool Calling)。模型可以自己写轻量程序来协调工具调用、过滤中间结果、监控任务进展,不用你手动编排每一步。过去Agent跑10轮迭代,每轮的工具返回都塞回上下文,Token越滚越大;现在模型自己决定哪些中间数据值得留、哪些可以丢。这是用量端的降本,比单价降价更狠。

ChatGPT Work:从助手到超级应用

模型是弹药,ChatGPT Work是枪。它不是又一个聊天框,而是一个能连续工作数小时、跨网页和桌面应用、自主生成文档、表格、幻灯片乃至网站的执行型智能体。你可以让它读Slack消息生成周报、监控网站变化更新PPT、定时跑数据整理——人在手机上派活,回桌面看结果。

更关键的是整合。Atlas浏览器关停,Codex并入,新版桌面端一个入口统了Chat(快问快答)、Work(长任务交付)、Codex(写代码)。Codex每周服务500万以上用户,其中超过100万人已经用在编程之外。OpenAI的逻辑很直白:不想做"又一个AI工具",要做"AI时代的操作系统",文档表格只是敲门砖,习惯一旦养成就能吃掉更多企业工作流。

开发者该重新算的三笔账

第一,跑分不是选型标准,成本结构才是。Fable 5在SWE-bench Pro领先20分,但一个长周期Agent任务跑下来,Terra或Luna的成本可能只有它的十几分之一。你的真实工作负载里,有多少任务非得上80.3%那个档?多数日常编码,64.6%的Sol甚至更便宜的Terra已经够用。

第二,警惕"按量计费"的账单失控。Anthropic把Fable 5移出订阅、OpenAI的Agent消耗远超普通对话——一个跑几小时的多步任务,账单可能超过一次Google Workspace月费。给Agent设止损线、开prompt caching、用便宜模型做路由,这些比盯着单价更有用。

第三,超级应用的锁定风险。ChatGPT Work把你的文档、代码、日程都收进一个入口,效率是真高,但迁移成本也是真高。在它还没垄断你的工作流之前,想清楚哪些数据愿意交出去。

7月9日之后,AI编程的竞争从"谁的模型更聪明"变成了"谁能让开发者用得起、用得久"。Fable 5证明了能力上限,GPT-5.6证明了价格下限,ChatGPT Work证明了入口的价值。你不需要站队,但你需要重新算账。