8月第一周,几件事同时砸下来。7月30日,OpenAI把GPT-5.6 Luna的输入价从1美元砍到0.2美元每百万Token,降幅80%;Terra同步降20%。7月31日,DeepSeek V4-Flash正式版API上线,缓存命中每百万Token低至0.02元。8月3日,阿里发布Qwen3.8-Max——2.4万亿参数,在自动化编程测试里连续独立运行16天,GitHub上产出265次提交、127个PR、151个issue,并宣布下周开源权重。
财联社8月4日用"两把价格屠刀"形容这场AI Coding价格战。但如果你是每天用AI写代码的开发者,真正会改变你工作方式的,不是Token便宜了几分钱,是模型能连续干16天不用你盯着了。
价格确实在降,但你的体感可能滞后
一线开发者的感受没那么戏剧化。一位后端工程师告诉财联社,他用Codex配合ChatGPT订阅,月均消耗30到50亿Token,"订阅模式下月费没变,短期内价格变化还不明显"。另一位开发者用阿里Qoder高级版169元一个月,也说"还没明显感受"。
这不是错觉。订阅制吸收了价格波动,真正对单价敏感的是走API的重度Agent用户和企业。但价格战传递的信号比账面数字更重要:模型层的能力曲线正在变平,竞争从"谁更聪明"转向"谁更便宜、更开放"。
Qwen3.8干了一件别的事:16天,265次提交
8月3日Qwen3.8-Max发布里,最该被注意的不是2.4万亿参数,是一条测试记录:模型从一个空文件夹出发,接到"创建一个自进化的智能体Harness"的指令后,无人干预,独立运行约16天,完成了oh-my-cli项目的自动建构。整个过程——需求归一化、智能体自动认领任务、代码生成、E2E测试、CI检查、PR自合并——在GitHub仓库qwen-code-dev-bot/oh-my-cli里全程公开可追溯。
16天。265次提交。127个PR。151个issue。零人工干预。
这不是"补全一个函数"。这是模型自主完成规划、编码、测试、交付的完整工程闭环。阿里还提到,Qwen3.8-Max在科研场景连续自主工作约125小时复现论文并完成四轮自我进化,在芯片设计沙箱里经历约500轮交互把硬件门数从8298门精简到678门,在量化投资里调度约330个子智能体完成约6000次因子回测。
这些数字指向一个质变:模型开始具备长程自主工作的能力。过去你给AI一个任务,它给你一段代码,你来集成。现在你给AI一个目标,它自己干十几天,给你一个能跑的项目。
OpenAI丢掉的不是模型,是开发者的日常工作台
价格战和长程自主能力背后,是一个更大的格局变化。8月1日《华尔街日报》报道:Anthropic的收入增速和私募估值已经超过OpenAI,估值接近1万亿美元,主要靠Claude Code的成功。
故事的关键不在谁的模型跑分高。WSJ还原的经过是:OpenAI的推理模型本擅长写代码,但早期Codex训练偏竞赛式编程,没进入真实代码库、理解上下文、调用工具的工程场景。Anthropic在2025年2月用Sonnet 3.7卡住了"真实任务"这个位,然后把Claude Code做成了开发者每天要用的工作台。
Weave的数据覆盖200多家客户:Claude Code用户人均月成本从1月的69美元升到6月的219美元,活跃用户却增至三倍。Workato称约80%编码发生在Claude Code。企业没有因为涨价离开,而是把简单任务路由给更便宜的模型。OpenAI现在补的不只是一代模型,是产品、销售、渠道和定价的整套系统。彭博报道Codex周活已超500万,ChatGPT Work加Codex合计1000万用户。但Polymarket给Anthropic开出的"8月底仍持最佳模型"概率是93%。
对开发者,这意味着三件事
第一,别再只盯跑分选模型,盯"长程稳定性"。 Qwen3.8-Max在8月3日Arena放榜里Text第5、Vision第2、Code Arena前端第4、PaperBench 93.0反超Fable 5的88.8。但SWE-bench差几个百分点,在你的真实项目里可能完全感知不到。真正影响交付的是:模型能不能长时间保持上下文一致、会不会在中途忘了最初目标、出错后能不能自己纠偏。这些只能在你自己的任务上试。Qwen3.8-Max下周开源权重,本地部署试错成本进一步降低,正是验证长程稳定性的好时机。
第二,把"长程任务审计"纳入工作流。 当模型能连续干16天,开发者的核心动作从"指挥每一步"变成"审计结果"。265次提交你不可能逐行看。能做的是:每隔N次提交自动跑测试、设置Token消耗告警、用git diff做阶段性review而不是等全部跑完。这要求项目本身有测试覆盖、有CI、有清晰的提交规范。没有这些基础设施,长程自主编程的结果你根本接不住。还得给Agent设止损线——阿里芯片测试跑了500轮交互,没有成本上限和异常检测,一个跑偏的Agent能在你睡觉时烧掉一整周预算。
第三,别绑死单一供应商。 Qwen3.8-Max开源、GPT-5.6 Luna白菜价、DeepSeek V4-Flash继续下探——选择从来没有这么多过。但价格战也会让工具突然调价、关停、改条款。TheInformation报道Globant把开源权重模型的Token占比从5%提到35%,成本比Anthropic低50%到80%。用AGENTS.md保持跨工具兼容,备一个能接任意模型的开源客户端,把选择权留在自己手里。
Token在变便宜。但"不用人盯着"的那16天,才是真正会重写你工作流的东西。准备好接住它。