免费期倒计时归零
7 月 20 日,Anthropic 的 Fable 5 计划内免费额度正式到期。从这一天起,Pro/Max/Team 套餐用户超出限额的部分按 API 费率计量收费——输入 $10/百万 Token,输出 $50/百万 Token。
这个时间节点值得记住。过去三周,Anthropic 两次延长 Fable 5 的免费期,从 7 月 7 日延到 7 月 12 日,再延到 7 月 19 日。每次延长的措辞都是"应社区反馈",但潜台词很清楚:习惯了"免费"用顶级模型的开发者,还没准备好面对真正的账单。
而就在免费期结束的 11 天前,OpenAI 发布了 GPT-5.6 三档模型——Sol、Terra、Luna。其中 Terra 在 Artificial Analysis 编码智能体指数上几乎追平 Fable 5(77.4 vs 77.2),输出 Token 成本只有 Fable 5 的三分之一。
80 分背后的 Token 经济学
GPT-5.6 Sol 在编码智能体指数上拿到 80 分,比 Fable 5 高 2.8 分。但真正让开发者注意的不是分数,而是 Sam Altman 公布的一个数字:编码任务平均减少 54% 的 Token 消耗。
在 Agent 时代,Token 就是计算资源的计量单位。一个"帮我重构这个文件"的请求,背后可能是:
- 读取目标文件(3K–8K 输入 Token)
- 加载关联文件(10K–30K Token)
- 推理思考(5K–20K 输出 Token)
- 工具调用与验证往返
一个用户回合就是 5 万到 8 万 Token。按 Fable 5 的费率,单次回合 $0.5 到 $1.3。一个 4 小时的编码会话跑 60 个回合,就是 $30 到 $78——这还是在一切顺利的前提下。
GPT-5.6 Sol 把同样的任务成本压到约三分之一。这不是降价促销,是结构性改变:更少的 Token 意味着更短的推理时间、更低的延迟、更少的上下文膨胀。
Agent 失控的三个真实案例
Token 效率不是抽象的数字游戏。当 Agent 被授予自主权后,账单可以在几小时内失控。
案例一:数据库优化,3 小时烧掉 $1400。 一位创业公司 CTO 让 Claude Code Agent 优化数据库查询性能。Agent 自动分析慢查询、重写 SQL、创建索引、跑回归测试。3 小时后查询延迟从 800ms 降到 50ms——但 API 账单 $1400,Agent 执行了超过 1200 次数据库查询,Token 消耗在"假设-验证-推翻"循环中指数增长。
案例二:修复 ESLint 警告,单日 $800。 Cursor 用户让 Agent 修复所有 ESLint 警告。Agent 陷入"修复→引入新警告→修复新警告→引入更多警告"的死循环,烧掉约 400 万 Token 才被手动终止。
案例三:Claude Code 装上了刹车。 7 月 17 日,Anthropic 发布 Claude Code v2.1.212,给 Agent 加了硬限制:单会话 Web 搜索上限 200 次、子 Agent 生成上限 200 次,均可通过 /clear 重置。同时 Enterprise 版上线成本控制面板,管理员可按用户设预算上限、自动阻断超额调用。
这些"刹车"的出现本身就说明了一个问题:AI 编程工具正在从"帮你写一段代码"变成"帮你运维一个系统"。前者几万 Token 够了,后者可能跑一整晚。
开发者现在该做什么
Fable 5 免费期结束不是终点,而是一个信号——AI 编程的补贴时代结束了。以下四条行动建议按优先级排列。
立即审计 Token 消耗
不要等月底账单。在 Claude Code 中设置 CLAUDE_CODE_MAX_WEB_SEARCHES_PER_SESSION 和子 Agent 生成上限。如果你用 API 直接调用,加上重试次数限制和单任务 Token 上限。
按任务复杂度分配模型
不要用 Fable 5 做所有事。GPT-5.6 的三档模型就是为分层而生的:
| 任务类型 | 推荐模型 | 输入/输出($/百万Token) |
|---------|---------|----------------------|
| 日常补全、简单重构 | Luna | $1 / $6 |
| 多文件修改、工具调用 | Terra | $2.5 / $15 |
| 架构设计、安全审计 | Sol 或 Fable 5 | $5–10 / $30–50 |
开启 Prompt 缓存
Anthropic 的 Prompt 缓存定价意味着重复的 10 万 Token 系统提示词,缓存命中后成本约为首次调用的 10%。很多团队多付了几倍的钱,仅仅因为没开启缓存头。
给 Agent 设预算,不是只给权限
"优化数据库性能"和"修复所有警告"都是权限,但不包含"花多少 Token"的限制。在 Enterprise 成本控制面板中按用户设预算上限。自建工作流的,在 Agent 循环里加 Token 累计检查,超限自动终止。
降价的尽头是一度电的账
过去半年,头部模型价格战打得热闹:GPT-5.6 比 GPT-5.5 便宜,Terra 追平 Fable 5 但价格只要三分之一,Luna 的百万 Token 输出只要 $6。但 Token 降价的尽头不是零——是一度电的账、一颗芯片的折旧、一个数据中心的冷却水。
对开发者来说,真正的竞争已经不在"谁的分更高",而在"谁能让 Agent 跑一整晚而你不心疼"。Fable 5 的免费午餐结束了,AI 编程的成本故事才刚刚翻到第一章。