9月1日和2日,48小时里发生了三件事,指向同一个结论:AI编程的竞争已经从"每百万Token多少钱"变成了"完成一笔任务多少钱"——但这笔账,目前没人算得清。
三件事同时砸下来
第一件:Anthropic发布Fable 5.1,缓存读取价从1美元砍到0.25美元每百万Token,降幅75%。 输入输出标价没动,还是10美元和50美元。Anthropic拿自己8月的实际用量算了一笔账:典型工作负载成本降约25%,高度Agent化任务最高降45%。同一套底座拆出Mythos 5.1,关闭安全护栏后250次Firefox漏洞测试里245次生成了可用漏洞利用代码,成功率98%。
第二件:Cognition接近完成约10亿美元融资,估值470亿美元,三个月翻倍。 彭博9月2日报道,Cognition年化收入从5月的4.92亿美元涨到9亿美元以上,投资者认购意向近100亿美元。Cognition联合创始人Walden Yan当天宣布:把Devin里的Opus 5流量搬到Fable 5.1,原话是"a Fable-class model is finally economical"——Fable级模型终于划算了。
第三件:阿里Qwen3.8-Max-0902登顶Code Arena WebDev,1691分,超过Opus 5 Max的1688分和Kimi K3 Max的1674分。 定价只有输入2美元、输出6美元每百万Token,是Fable 5.1标价的五分之一到八分之一,权重已经开源。
同一个模型,两份相反的账单
Fable 5.1到底省钱还是费钱?取决于你信谁的测量。
Cognition在自家的FrontierCode 1.1 Extended基准上测:Fable 5.1单笔任务成本从Fable 5的5.84美元降到2.68美元,降了54%。超过95%的Token走缓存读取,Fable 5.1比Opus 5少用33%的Token。
但Artificial Analysis——Anthropic自己的预发布评估合作方——测出来相反:在最大推理强度下,Fable 5.1单笔Intelligence Index任务成本3.76美元,比Fable 5的3.14美元贵了20%。原因是Fable 5.1输出了约1.7倍的Token。缓存便宜省了约1.40美元,但多吐的输出把省下的全吃回去了。
更扎心的对比:Opus 5在Intelligence Index上拿63分,比Fable 5.1的66低3分,但单笔任务成本只有2.34美元——分数几乎打平,价格便宜60%。
这就是为什么Ramp统计7万家企业的数据显示,Fable 5上线两个月只占Anthropic消费的11.4%、Token量的6%。隔壁GPT-5.6 Sol同期占OpenAI Token量的25%、收入的23%。Anthropic 7月年化收入650亿美元,低于投资人预期的800亿。公司10月要按2万亿美元估值冲刺IPO——旗舰卖不动,叙事就撑不住。
"单笔任务成本"到底该怎么测
OpenAI CFO Sarah Friar和Anthropic金融业务负责人Jonathan Pelosi最近都在推同一个话术:Token价格只是代理指标,企业真正该看的是完成一个任务花多少钱。D.A. Davidson分析师Gil Luria说得更直白:"美国实验室想传达的是,用开源Token就像用便宜厕纸——确实能擦干净,但你需要更多张,还有别的副作用。"
但Vals AI CEO Rayan Krishnan指出关键问题:实验室自报"单笔任务成本"时,"几乎都用内部基准,根本做不到苹果对苹果的比较。"
事实是,你的"单笔任务成本"取决于三个你自己才知道的变量。
缓存命中率。 Cognition的Devin长时间跑同一套代码库、系统提示和工具定义,95%以上的Token走缓存,Fable 5.1的0.25美元缓存价就是为这种场景设计的。但如果你每次调用都换上下文,缓存红利为零,你付的还是10美元原价。
推理强度档位。 Artificial Analysis测了三档:max effort时3.76美元/任务、66分;xhigh effort时2.72美元、65分;降一档分数只掉1分,成本降28%。Anthropic自己也承认Fable 5.1在max effort下并不总是更好——InfoQ测试发现High模式比Low模式更慢,召回率反而更低。
输出Token量。 Fable 5.1在复杂任务上倾向于生成更多输出——更长、更详尽的推理链。如果你的任务对输出长度不敏感(比如只需要一个补丁),多出来的Token就是纯浪费。
开发者该怎么做
第一,别信厂商自报的"降本百分比",自己测。 拿你的真实任务——不是跑分——跑三天,记录四个数:任务成功率、输入Token、输出Token、缓存命中率。用Fable 5.1和Opus 5各跑一遍同样的任务集,算你的"单笔成功任务成本"。Vals AI测出Fable 5.1跑一个Index测试平均73分钟28.40美元,Opus 5只要56分钟19.28美元——时间差近50%,成本差47%。这个比例在你自己的任务上可能完全不同。
第二,分层用模型,别一刀切。 Anthropic自己在系统卡里都说Fable 5.1"并非所有编程任务的默认选择"。日常小规模PR用Opus 5或更便宜的Sonnet 5(2/10美元),跨文件的大型重构和长程Agent任务才上Fable 5.1。Uber已经给每个员工每月AI编程工具设了1500美元上限,Walmart也给内部Agent设了用量封顶。Ramp数据显示中位数企业每月AI人均支出只有11.95美元——大多数场景根本不需要旗舰。
第三,把开源权重当退路,别把宝押在闭源旗舰的定价策略上。 Qwen3.8-Max-0902在Code Arena WebDev上1691分全球第一,权重开源,激活参数950亿,2/6美元的定价让自建集群推理第一次在账面上接近直接调API。Meta MuseSpark 1.3的Contributor档0.10/0.20美元,Intelligence Index也有61分。Anthropic的缓存降价、OpenAI的Token促销、Cognition的估值翻倍——这些都是在窗口期内抢用户的动作。窗口关上,价格随时回调。Gemini 3.8 Flash现在0.75/3.75美元的促销价到年底结束,2027年直接翻倍到1.50/7.50美元。用AGENTS.md保持跨工具兼容,备一个能接任意模型的开源客户端,把选择权留在自己手里。
"单笔任务成本"是真问题。但厂商的算盘和你的账本,用的是两套输入。别替他们算——自己跑一遍。