如果你最近觉得 AI 编程的账单涨得比能力快,那不是错觉。2026 年 8 月到 9 月的这一个月里,模型厂商干了一件过去很少干的事:不再只宣传"模型更强了",而是开始手把手教你少花钱。
这个月发生的三件事
第一件:9 月 1 日 Claude Fable 5.1 发布,并成为 Claude Code 的默认模型。 标价没变,仍是输入 10 美元 / 百万 token、输出 50 美元 / 百万 token;真正变的是缓存读取价,从 1 美元 / 百万 token 降到 0.25 美元 / 百万 token,降幅 75%。Anthropic 给出的口径是:典型负载成本下降约 25%,高度 agentic 的负载最多下降 45%。
这里有个细节值得单独拎出来说。Fable 5.1 在 Claude Code 里默认 High effort,而在 Claude Cowork 和网页端默认 Medium。Anthropic 自己在发布说明里承认,Low 或 Medium effort 下的 Fable 5.1,能以低得多的成本达到接近甚至优于 Fable 5 的效果。翻译过来就是:你拿到的默认配置,并不是最便宜的那一个。
第二件:9 月 8 日 Anthropic 发了一篇官方博客,系统讲了三个省钱抓手:把 prompt cache 命中率拉满、清掉为了"补旧模型的坑"而写进提示词的指令、给 effort 按任务定档。配套的 /claude-api 提示词审计命令,官方实测平均降本 14.6%,平均准确率反而提升 5.3%。
第三件:Claude Code v2.1.236 到 v2.1.268 这一串更新日志。 单看每一条都很琐碎,连起来看方向极其清楚——成本控制正在变成产品功能本身。
第一笔账:你的钱不是花在"贵",而是花在"重发"
理解这点,得先明白 prompt cache 在算什么。Claude Code 每一轮请求都会重发完整上下文:系统提示词、工具定义、项目上下文、历史消息和工具结果、你的新消息。缓存的作用是让你不必为重复的部分按原价付费——命中缓存的读取价大约是原价的一折。
所以真正的成本杀手不是单次价格贵,而是缓存没命中。
几个最常见的踩坑:
- 中途改 effort 或切模型。 这些设置会渲染在实际消息之前,改一次就等于前缀变了,缓存直接作废。Fable 5.1 开始允许会话中途更新 effort 而不破坏缓存。
- 把动态值塞进前缀。 系统提示词里放一个时间戳或随机 request ID,每次调用前缀都不同,命中率归零。正确做法是:静态内容放前面,动态内容追加到尾部。
- 工具定义顺序抖动。 Claude Code 已修复两个典型场景:中途加载 MCP / 插件工具不再重写工具列表,切换模型也不再重发全部工具定义;OAuth token 刷新失效缓存的老 bug 也修了(长会话里大约每一小时炸一次)。
- 子 agent 拖过 TTL。 默认缓存 TTL 是 5 分钟,同步等待一个跑十分钟的子任务回来,父会话的缓存早过期了,下一轮要按 1.25 倍价格重写(1 小时 TTL 则是 2 倍)。
好在现在有了两个诊断手段:/cost 里新增了 per-session 缓存统计,直接告诉你命中率、重缓存的 token 数、以及这一轮为什么没命中;v2.1.248 起可以设置长缓存。
# 让 dev / CI 里的长会话使用 1 小时缓存
export ENABLE_PROMPT_CACHING_1H=1
想在会话开始前预热缓存,可以发一个 max_tokens: 0 的请求,只做 prefill 不生成内容——用户在输入框里打字那几秒正好用得上。
第二笔账:effort 是最容易被忽略的价格旋钮
过去我们调模型价格只能换模型,现在多了一个维度:同一模型花多少推理。
一个重命名变量的活儿和一个跨十二个文件的重构,用同一个 effort 档位,显然不合理。Claude Code 现在支持给模型封顶 effort,写在 .claude/settings.json 里:
{
"modelSettings": {
"claude-fable-5-1": { "maxEffortLevel": "medium" }
}
}
建议的做法是默认 medium,只在真正卡住时手动拉高。多数任务不会察觉差别,但你的账单会。
配合任务路由效果更明显。当前这批低价模型(2026 年 9 月价格,随时可能变动):DeepSeek V4 Flash 约 $0.14/$0.28 起(8 月 16 日起引入峰谷计价,UTC 工作日 01:00–04:00、06:00–10:00 为高峰);GPT-5.6 Luna 降至 $0.20/$1.20;Gemini 3.7/3.8 Flash 入门价 $0.75/$3.75。让 CI、批量重构、第一遍草稿走便宜模型,把 Fable 5.1 / Opus 留给需要长链路推理的活儿,这笔账很划算。
第三笔账:提示词里那些"以防万一",是最贵的部分
Anthropic 在博客里点名了一类反模式:为旧模型的弱点打的补丁。比如"请一步一步思考""务必检查是否有多余的括号"——这些指令当年有效,模型换代后不但没用,还在每一次调用里占着位置。
这就是那条 14.6% 的来源:删掉它们,成本降,准确率反而升。
配套的几个具体到可以立刻执行的建议:
- CLAUDE.md 控制在 200 行以内。 它每次会话都加载,哪怕你在做完全无关的事。
- 切换无关任务时用
/clear,而不是/compact。/clear不花钱;/compact要额外发一次带全部历史的总结请求。缓存热的时候便宜,冷会话里它是全场最贵的一次调用。 /autocompact阈值可以自己调,范围是 100K 到 1M token,命令行、启动参数、环境变量CLAUDE_CODE_AUTO_COMPACT_WINDOW三处都能设。- 跑
/skill-doctor,看看哪些加载了却从没用过的 skill 在白占上下文。
别把促销价当成长期价
这轮降价潮里有几个数字是带保质期的,做成本模型时务必留意:
| 模型 | 当前价(输入/输出,美元每百万 token) | 备注 |
|---|---|---|
| GPT-5.6 Sol | 4 / 20 | 促销价,官方口径"至少到 2026 年 11 月 21 日" |
| Gemini 3.7 Flash | 0.75 / 3.75 | 入门价(introductory),2027 年 1 月 1 日回到 1.5 / 7.5,直接翻倍 |
| DeepSeek V4-Pro | 峰值 3.96 / 谷值 1.98(输出) | 8 月 16 日起较此前上调约 4 倍 |
| Claude Sonnet 5 | 2 / 10 | 原定 9 月 1 日涨到 3 / 15,已取消,变为长期标准价 |
真正值得注意的信号其实是最后一行:一次永久降价比十次限时促销更有信息量,但它被大多数人忽略了。
一度电的账
把视线从账单挪到供给侧,会看到同一件事的另一面。
每一个 token 的成本里,电力都是绕不开的一项。西部算力枢纽的电价已经压得很低:内蒙古和林格尔、乌兰察布到户电价约 0.35 元/度,宁夏中卫稳定在 0.36 元/度左右,新疆石河子的绿电项目甚至做到 0.25–0.32 元/度;东部工商业电价普遍在 0.6–1.0 元/度。粗略看,电费一项最多能砍掉六成。
但便宜的电并没有便宜到可以无限撒钱:
- 电费只占大模型全生命周期成本的约 20%,剩下的是设备折旧、基建、带宽和运维。
- 一个 1GW 的数据中心,年电费约 13 亿美元,而 470 亿美元总投按 6 年折旧,年折旧约 79 亿美元——折旧是电费的六倍以上。
- 反过来,如果只看不含折旧的日常运营现金流,电费占比高达 56.7%,电价从 0.7 降到 0.3 元,运营支出能降约 32%。
- 海外更紧张:主要市场的加权电力成本已从 2021 年的约 0.03 美元/千瓦时,涨到 2026 年的 0.055–0.075 美元/千瓦时。
结论其实很朴素:厂商真正要降的,不是每一百万 token 的标价,而是每一度电、每一块 GPU 小时能产出的"有效 token"。 缓存命中率、effort 定档、提示词瘦身、精简的工具列表——所有这些事,方向完全一致。
好消息是,这件事恰好落在你能控制的范围内。
本周可以做的六件事
claude update升到最新版,老版本的缓存 bug 是真金白银在漏。- 跑一次
/claude-api提示词审计,看看那 14.6% 你具体能拿到多少。 - 在
.claude/settings.json里给默认模型加一个 effort 封顶,先试medium。 - 用
/model确认自己是不是已经挂在带[1m]标记的 Fable 5.1 上,网关用户可能需要手动更新。 - 把 CLAUDE.md 砍到 200 行以内,跑一遍
/skill-doctor清理僵尸 skill。 - 任何长会话结束后跑一次
/cost,读那行缓存命中率——现在它会直接告诉你原因。
降价是别人给你的,浪费是你自己的。在 token 越来越便宜的时代,把注意力从"选哪个模型"挪到"少发哪些 token",才是接下来一年真正拉开差距的地方。