人人都会AI编程

Anthropic两个月发了4个模型,回头一看:最贵的只比半价的强0.5%

更新时间:2026-07-25

7月24日,Anthropic发布Claude Opus 5。这是他们两个月内的第四个模型——6月连发Mythos 5、Fable 5、Sonnet 5,现在又来一个Opus 5。

但真正让开发者炸锅的不是发布频率,而是一组数字。

0.5%的差距,两倍的价格

Cursor公布的CursorBench 3.2编程测试榜单上,Max档(最高算力)的成绩是这样的:

  • Fable 5:70.5%,每任务17.32美元
  • Opus 5:70.0%,每任务8.23美元

落后0.5个百分点,价格不到一半,Token用量还少了40%。

更尴尬的是,在Extra High档(次高档),Opus 5的成绩反而全面超过Fable 5同档,每任务还便宜4美元。不开到顶配的话,便宜的反而更强。

连Anthropic自己的官方对比表都出了乌龙:FrontierCode v1.1那一行把Opus 5的53.4%加粗高亮成了"最优"——旁边一格明明写着Fable 5的53.5%。连制图的人都分不清谁赢了。

同价位能力翻倍,但旗舰也被追平了

Opus 5的定价和上一代Opus 4.8完全一致:输入每百万Token 5美元,输出25美元。Fable 5是10美元和50美元。

价格没涨,但能力直接翻倍。Frontier-Bench v0.1软件工程测试中,Opus 5拿到43.3%,Opus 4.8只有21.1%。ARC-AGI-3新题测试中,Opus 5得分30.2%,是第二名GPT-5.6 Sol(7.8%)的近四倍。

这不是"小幅升级",是同价位下能力翻倍。但问题是——它也快追上自家旗舰了。

在Artificial Analysis综合智能指数排行榜上,Opus 5以61分登顶,但Fable 5和GPT-5.6 Sol都在1-2分以内。HN上的开发者很快指出:GPT-5.6 Sol分数差不多,价格只有Opus 5的一半;Kimi K3分数也差不多,而且白送。7月27日K3正式开放权重,可以本地部署。

Anthropic在反向操作:性能不降,安全加码,价格减半

Opus 5做对了一件Fable 5没做的事:砍掉了30天数据留存要求。对企业来说,你的数据不会被暂存,也不会被拿去训练。

Anthropic称Opus 5是"迄今最对齐的模型",安全分类器触发频率比Fable 5低85%。新增了"自动降级"(Automatic Fallbacks)功能:当请求被标记为风险时,不会直接报错,而是路由到更弱的模型处理。在AI行业普遍"安全让步于性能"的背景下,这个反向操作本身就说明了问题——当前沿差距缩小到0.5%,安全反而成了差异化卖点。

早期用户还报告了一些意外能力:有人给Opus 5看了一张机器零件的图纸,它没有直接用标准库,而是自己写了一套计算机视觉流水线,从原始像素提取几何信息,重建了3D模型。另一个人让它做PPT,它选择从零写一个幻灯片渲染引擎,而不是调现成库。

旗舰模型还有存在的必要吗?

这是HN上被讨论最多的问题。如果Opus 5在绝大多数日常任务上追平甚至超过Fable 5,那Fable 5的定位就变得很尴尬。目前Fable 5仍有优势的场景很窄:法律分析、医疗专业测试、以及被Mythos 5接管的网络安全利用任务。

对开发者来说,真正的问题已经不是"用哪个模型",而是"什么时候该多花钱":

  1. 日常编程用Opus 5或GPT-5.6 Sol。两者智能指数几乎一样,GPT-5.6 Sol更便宜。Opus 5的优势在多步骤Agent任务和新题求解上。
  2. 需要本地部署时看Kimi K3。7月27日开放权重,数据不出基础设施。
  3. 旗舰只在特定场景调用。法律、医疗、需要顶级推理的硬题,频次应该很低。
  4. 用"努力程度"调节成本。Opus 5引入可调节的Effort设置,低档位下完成任务的数量仍超过其他模型。大多数任务不需要开满。

模型差距归零,竞争转向别处

当GPT-5.6 Sol、Opus 5、Fable 5和Kimi K3的智能指数都在57-61之间,而价格差最大达10倍时,"谁更强"已经不是正确的问题。正确的问题是:你愿意为单位智能的边际提升付多少溢价?

答案是:越来越少的人愿意付2倍。

Opus 5的发布标志着AI模型竞争进入新阶段:前沿模型之间的性能差距已经缩小到统计噪声级别,价格、数据策略、安全机制正在成为真正的差异化因素。Anthropic用Opus 5证明了"半价旗舰性能"的可行性——但这也意味着,他们自己最贵的那个模型,护城河只剩0.5%了。