9 月 15 日,OpenRouter 负责人 Peter Walker 贴出一张图:上周 OpenAI 模型的花销份额超过了 Anthropic。上一次发生这件事是 2024 年 2 月,中间隔了两年半。
真正值得琢磨的不是谁第一,而是花销榜和用量榜指向了完全不同的模型。
两张榜,两个赢家
先看同一周(9 月 7 日到 13 日)OpenRouter 上的两组数据:
| 维度 | 领先者 | 说明 |
|---|---|---|
| 花销份额 | GPT-6 Astra 19%、Claude Opus 5 16%、Sol 10%、Luna 10%、Sonnet 5 7%、Fable 5.1 6% | Astra 9 月 4 日才发布 |
| Token 用量 | GPT-5.6 Luna 约 15.8T 排第一 | 2–5 名是 DeepSeek V4.1 Flash、腾讯 Hy4 preview、GLM 5.3 Flash、DeepSeek V4 Flash |
| 厂商请求份额 | openai 23.6%、deepseek 22.6%、google 18.6%、anthropic 2.5% | Anthropic 未进用量前十 |
更微妙的一件事:按应用 token 量排,Claude Code 是平台上第二名(约 996B tokens,第一是 Hermes Agent 的 1.78T)。开发者每天都在 Anthropic 的界面里干活,却把推理请求路由给了别人家的模型。
用一句话概括就是:Anthropic 赢了界面,OpenAI 和 DeepSeek 赢了推理账单。
为什么会分家:一次集体重新定价
这事不是自然发生的,是被一次发布推出来的。
9 月 4 日 OpenAI 发布 GPT-6 Astra,$10/$50 每百万 token,105 万 token 上下文、12.8 万 token 最大输出,low 到 max 五档推理强度,原生计算机操作能力。对写 agent 的人来说,更实用的是三个细节:异步工具调用、任务执行中途改指令,以及在保留缓存的前提下动态调整推理强度。Codex 还在试验跨上下文窗口保存笔记和检索历史内容——这几项都是冲着长周期 agent 的连续性去的。
紧接着,GPT-5.6 三档(Sol / Terra / Luna)不但没退市,反而在 Astra 发布时集体降价:Sol 输出从 $30 降到 $20,Luna 输出从 $6 降到 $1.2,降幅 80%(Luna 是 7 月 9 日发布的,7 月 30 日就挨了这一刀)。
对照之下,Anthropic 在这轮记录里一次价都没动——Fable 5、Fable 5.1、Opus 5、Sonnet 5 至今都挂着发布日的价格。
结果是双层的:上面有一个卖稀缺能力的 Astra(输入价是 Luna 的 50 倍),下面有一个几乎白送的 Luna。而中间那一档,恰恰是过去大家默认付钱的地方,被两头夹住了。
对开发者的含义很直接:模型正在变成可替换的零件,工具层的护城河从"用哪个模型"变成了"工作流长什么样"。
质量在收敛,价格在发散
先看同一套独立 harness(vals.ai 的 mini-swe-agent,纯 bash)跑出来的 SWE-bench Verified,以及各家标价(2026 年 9 月,随时会变):
| 模型 | SWE-bench Verified | 输入/输出($/M) | AA 指数 | 每点指数成本 |
|---|---|---|---|---|
| Claude Opus 5 | 97.0% ±0.76 | 5 / 25 | 61 | $0.16 |
| GPT-5.6 Sol | 96.2% ±0.86 | 5 / 30(促销 4 / 20) | 61 | $0.18 |
| Grok 4.6 | 95.6% | 2 / 6 | 61 | $0.05 |
| Claude Fable 5 | 95.0% ±0.98 | 10 / 50 | 62 | $0.32 |
| Kimi K3 | 93.4% | 3 / 15 | 60 | $0.10 |
| DeepSeek V4 Pro | 96.4% | 0.66 / 1.98(谷值) | 53 | $0.02 |
每点指数成本是混合价(3:1 的输入输出比)除以 Artificial Analysis 智能指数。
这张表有两个结论,都很反直觉。
第一,前三名是平局,不是排名。 Opus 5 和 Fable 5 差 2 个百分点,约为 1.6 个合并标准差——落在误差范围内。也就是说,你为 Fable 5 多付的那 2 倍价钱,没有买到一个统计上可区分的编码能力。
第二,真正拉开的是钱。 同处 61 分这一档的 Opus 5、Sol、Grok 4.6,混合价分别是 10、11.25、3 美元;再往下看 DeepSeek V4 Pro 谷值不到 1 美元。最高和最低之间约 20 倍。
需要提醒的是:不同 harness 的分数不能互相比较。Anthropic 自报的 Sonnet 5 是 72.7%,vals.ai 口径下是 79.6%;Fable 5 那个 80.3% 的 SWE-bench Pro 用的是 Anthropic 自家 scaffolding,一直有争议。跨表比分数是选型里最常见的错误。
按"任务时长"选,别按品牌选
如果说上面那张表只能得出"大家都差不多",那么把结果按任务时长拆开,差异才真正浮现——这是目前三强之间唯一一处超出误差范围的真实分化:
| 任务时长 | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|
| 15 分钟以内 | 97% | 98% |
| 15 分钟 – 1 小时 | 95% | 97% |
| 1 – 4 小时 | 98% | 90% |
Opus 5 在短任务上小幅领先,Sol 在 1–4 小时的长链路任务上领先 8 个百分点。
这和大多数人的直觉相反:我们习惯给"难活"配贵模型,但数据显示,时长才是更准的分档依据。日常改个函数、补个测试,用 Opus 5 甚至更便宜的档位就够;跨十几个文件、跑几小时的重构,反而该换到 Sol 或 Astra。
三级路由,把模型名放进环境变量
具体做法很简单,关键是别把模型名写死在脚本里——这个市场一个月就换一茬。
export OPENROUTER_API_KEY=sk-or-...
opencode models --refresh # 先拉真实列表,slug 以输出为准
# 一档:15 分钟内的零活(补测试、改函数、写脚本)
cc() { opencode run --model "$AI_CHEAP" "$@"; }
# 二档:15 分钟到 1 小时的常规开发(排 bug、加功能)
ccm() { opencode run --model "$AI_MID" "$@"; }
# 三档:1 小时以上的长链路任务(跨模块重构、迁移)
cch() { opencode run --model "$AI_HEAVY" "$@"; }
在 shell 配置里只维护三个变量:
export AI_CHEAP="openrouter/deepseek/deepseek-v4-flash" # 或 GLM 5.3 Flash
export AI_MID="openrouter/anthropic/claude-opus-5"
export AI_HEAVY="openrouter/openai/gpt-5.6-sol" # 需要时加 --variant high
换模型只改一行。用 Claude Code 的话同理,/model 里随时切,别让它一直挂在你三个月前随手选的那个默认上。
三个容易踩的坑
促销价不是长期价。 GPT-5.6 三档在 Astra 发布时集体降价,官方口径是"至少到 2026 年 11 月 21 日"有效;Sol 的标准价是 $5/$30 而不是促销的 $4/$20。Gemini 3.8 Flash 的入门价到 12 月 31 日为止。做成本模型时一律按标准价算,把促销当意外之喜。
"1.05M 上下文"不等于一个价。 Astra 输入超过约 272K token(不同来源记为 200K,以官方为准)就进入更贵的长提示词档位。把整个仓库塞进上下文之前,先确认你踩在哪一档。
换模型不等于等价替换。 编码 agent 重度依赖工具调用、指令跟随和上下文处理,这几项的能力分布和"写代码"并不重合。opencode 自己的文档就写得很坦白:模型很多,但真正同时擅长生成代码和调用工具的没几个。任何新组合上线前,都该先跑一遍你自己的回归集。
这周可以做的四件事
- 跑一次
opencode models --refresh或/model,确认你现在默认挂在哪个模型、哪个价。 - 按任务时长分三档,写成 shell 别名,模型名放环境变量。
- 挑 20 个你们自己仓库里的真实 issue 当回归集,两三个候选模型各跑一遍——别人的榜不如你自己的榜。
- 把成本模型里的促销价全部换成标准价,重算一遍。
榜单测量的是天花板,用量测量的是地板。OpenRouter 那周 124 万亿 token 里,前十一名的位置和 benchmark 榜单几乎不重合,因为绝大多数活儿都发生在地板上。
接下来一年真正拉开差距的,不是你选了哪个最强模型,而是你有没有把对的活派给对的那档价。