一个反常识的数字
2026 年 7 月,麦肯锡发布了一份让 CTO 们坐不住的报告:93% 的企业 AI 团队已经超预算,而单次任务 Token 消耗量是普通对话的 5 到 30 倍。
同一时期,GPT-3.5 级能力的推理成本从 20 美元/百万 Token 跌到 0.07 美元——累计降幅超过 99%。
Token 越卖越便宜,账单却越来越失控。这不是某几家公司管理不善,而是一场正在席卷整个行业的结构性错配。
Uber 的四个月
Uber 是最典型的案例。今年年初,公司给 5000 名工程师全面开放了 AI 编程工具,工程师普及率很快达到 95%。管理层还搞了个"AI 使用量排行榜",员工为了刷榜,让 AI 重写已经写好的代码、生成毫无用处的架构图,只为排名好看。
四个月后,全年预算被打穿。人均月账单 500 到 2000 美元不等,一次两小时的演示就能烧掉 1200 美元。Uber 总裁紧急下令:每人每月 AI 工具开销上限卡死在 1500 美元。
Uber 不是孤例。花旗银行被迫封禁 Claude Opus 和 GPT-5.5 等顶级模型,因为开发人员吃掉了大部分共享 Token 池;Atlassian 的 AI 月支出从 500 万美元飙到 1500 万美元,一年翻了三倍;亚马逊单月 Token 支出高达 5 亿美元。
钱到底花在哪了
麦肯锡的 QuantumBlack 团队给出了精确拆解:60% 的 Agent 成本花在"响应精修"上——也就是 Agent 在返回最终答案前,反复检查、修改、重新生成自己输出的那个循环。
一个 Agent 执行任务,背后可能调用几十次模型:查资料、做推理、生成内容、自我修正。每一次调用都在烧 Token。多 Agent 协作更夸张,信息在多个 Agent 之间来回传递,Token 消耗呈指数级增长。
Citadel 证券的报告里有一个已经发生的案例:中小企业在业务 Agent 化之后,每个任务的 Token 消耗变成了原来的 3.5 倍——不是总用量涨 3.5 倍,是每个任务。
更扎心的是 Faros AI 对两万名开发者做的两年跟踪:Token 消耗最大的工程师,产出大约是普通工程师的两倍,但他们消耗的 Token 是普通工程师的 10 倍。
"裁人换 AI"的账,半年后才开始算
Token 账单只是硬币的一面。另一面是"裁人换 AI"的连锁反应。
一项对 300 多家企业 HR 的访谈显示,有 36% 的公司在裁掉员工后,不得不把其中一半人重新招回来,原因是"AI 还不够稳定,很多活还是得人来干"。
技术债的数据更直白。研究显示,AI 生成的代码引入的 Bug 是人类手写代码的 1.7 倍,安全问题在代码库中的存活率高达 41%。到第二年,缺乏管理的 AI 辅助开发会将维护成本推高到正常水平的 4 倍。
行业已经出现了"回旋镖式招聘"(boomerang hiring)——2026 年初,35% 的新技术岗录用者是前员工被请回来的。
原因很简单:编码从来不是最难的部分。AI 让"写代码"变便宜了,但让"判断该写什么、为什么这么写、出了问题怎么救"变得更重要了。而这些恰恰是高级工程师的工作。
基准测试不是真实工作
还有一个被广泛误读的数字。顶级编程 Agent 在 SWE-bench Verified 上的得分已经达到约 80%。听起来像是"5 个工单能独立解决 4 个"。
但真相是:
| 测试场景 | 测量内容 | 顶级 Agent 得分 |
|---------|---------|----------------|
| SWE-bench Verified | 单仓库、有测试的限定 Bug 修复 | ~80% |
| 真实 PR 合并率 | 人类审查者实际合并的变更 | 35-50% |
| 工业级移动端任务 | 生产代码库、真实功能开关 | 12% |
最后那行才是值得停下来想的。在工业级移动端任务基准上,最好的 Agent 配置只完成了 12% 的任务。失败原因中 54% 是因为 Agent 不理解"功能开关"(feature flag)——一个基本的生产行为,在干净的基准测试里根本不会出现。
Agent 在干净、明确、单文件的问题上很强,一旦任务需要跨文件推理、团队隐性知识或"我们这里就是这么做的"这类上下文,能力就断崖式下跌。
给团队的 4 条实操建议
1. 别让旗舰模型干杂活
麦肯锡报告指出,昂贵的前沿模型经常被部署在廉价小模型就能搞定的常规任务上。分层用模型:简单任务(格式化、文档、单元测试)用中端,复杂任务(架构设计、跨模块重构)才上旗舰。 这一招能砍掉 30-50% 的 Token 支出。
2. 给 Agent 设"预算墙"而非"权限墙"
每个 Agent 任务设置 Token 预算上限,超了就暂停并交回人工。别让 Agent 无限循环——60% 的钱花在"响应精修"上,而大多数精修循环并不产生增量价值。初始预算设为单任务预估的 3 倍,观察一周后收紧。
3. 撤掉"AI 使用排行榜"
Uber、亚马逊都在撤掉内部 AI 使用量排行榜后迅速见效。排行榜激励的是"消耗"而非"产出"。改用"交付价值/Token 消耗"的效率指标,而非原始使用量。
4. 保留"结构守门人"
无论 Agent 多强,至少保留一名能看懂整体架构的工程师做合并审查。这个人不看代码细节,只看三样东西:命名一致性、模块边界、循环依赖。 这个 30 秒的检查能挡掉大部分 AI 生成代码引入的结构性问题。
写在最后
Token 降价 99% 和账单翻 3 倍同时成立,因为模型变便宜后,用量暴涨的速度远超单价下降的速度——经典的杰文斯悖论。
但更深层的账其实是这样算的:AI 省下了编码的 keystroke,却让你更需要判断力、架构经验和善后能力。裁掉这些人省下的钱,半年后以 Token 账单、技术债和回旋镖式招聘的形式连本带利地回来了。
在你决定"裁掉最后一个工程师"之前,先算清这笔账。