两件事,同一周
7 月 25 日傍晚,OpenAI 的 API、ChatGPT、Codex 三线同时报错,31 个服务组件性能下降,宕机持续近两小时。这不是一次孤立的偶发事故——钛媒体统计显示,OpenAI 已连续 17 天没有过完全正常的一天。
就在第二天,7 月 26 日,Anthropic 正式发布 Claude Opus 5,定价仅为旗舰 Fable 5 的一半,但在编程、推理等核心任务上性能几乎持平。Opus 5 同时成为 Claude Max 的默认模型。
两件事放在一起看,传达的信号再清晰不过:AI 办公工具的选型逻辑,正在被彻底重写。
模型通胀结束了
过去两年,AI 办公用户的默认操作是买最强的。GPT-4 出来买 GPT-4,Claude 3.5 Sonnet 出来换 Sonnet,GPT-5 出来追 GPT-5。理由很朴素:模型越强,产出越好。
但这个逻辑的前提——模型之间存在显著的能力差距——正在消失。
进入 2026 年 7 月,四大 AI 实验室在一个月内密集发布了新一代模型:xAI 的 Grok 4.5、Anthropic 的 Claude Opus 5、OpenAI 的 GPT-5.6 家族、月之暗面的 Kimi K3。独立评测显示,最强模型和最弱模型之间的差距,比以往任何一代都小。
这不是某一家掉队了,而是整个赛道的技术红利在趋同。训练数据流程标准化、开源研究加速扩散、算力成本持续下降——所有玩家在同一个方向上发力,结果就是模型能力的均值回归。
稳定性和成本,比跑分重要十倍
对 AI 办公用户来说,模型趋同意味着什么?
第一,稳定性开始比跑分重要。OpenAI 连续 17 天不稳定,对偶尔聊天的用户只是等一等就好,但对把 AI 嵌入日常工作流的人来说,每一次宕机都是一次业务中断。用 AI 写周报、做表格、生成 PPT 的人,最怕的不是模型不够聪明,而是写到一半服务崩了。
第二,成本差异值得认真算一笔账。Claude Opus 5 以一半的价格提供接近旗舰的性能。当模型能力差距缩小到个位数百分点,花两倍的钱买那 3% 的额外性能,对大多数办公场景根本不划算。
第三,别只挂在一个模型上。智能模型路由工具已经成熟到可以按任务难度自动切换模型——简单任务调低成本模型,复杂任务切高性能模型,综合成本可降低 60% 到 80%。日常办公中大量帮我总结这个 PDF、把这段话改通顺之类的轻量任务,用旗舰模型纯属浪费。
三条立刻能用的建议
1. 建立双模型工作流。 高频轻量任务(改写、总结、翻译)走性价比模型,低频高难度任务(复杂数据分析、长报告撰写)再上旗舰模型。别让 80% 的简单任务吃掉你 100% 的预算。
2. 关注国产办公智能体。 金山办公 7 月发布的灵犀专业版,已经能直接在 WPS 里生成可编辑的 PPT、保留公式的表格、支持审阅修订的文档。它不是聊天框加复制粘贴的伪 AI 办公,而是原生打通办公软件的真正智能体。国内办公场景下,这类工具的实用性可能超过任何海外旗舰模型——因为它直接交付结果,而不是交付一段文本让你自己再加工。
3. 把工具链思维替代选模型思维。 模型只是发动机,决定一辆车能不能跑起来的,是数据是否打通、系统是否连接、流程是否闭环。与其花时间比较模型跑分,不如花时间把自己的工作流跑通。
结尾
Claude Opus 5 半价发布和 OpenAI 连续宕机,是同一枚硬币的两面:AI 办公的竞争,正在从比谁更聪明转向比谁更可靠、更便宜、更好用。
对普通办公用户来说,这是好事。你再也不需要追最新的旗舰模型,也不需要忍受不稳定的服务。真正的 AI 办公,不是模型帮你写了一篇漂亮文章,而是你交代一个任务,它从理解、执行到交付,全程不掉链子。
最贵的模型,正在变成 AI 办公里最不重要的东西。