7 月 9 日,战场换了
7 月 7 日,Anthropic 把 Claude Cowork 推上了网页和手机端。48 小时后,OpenAI 把 ChatGPT、Codex 和浏览器自动化塞进一个壳里,取名 ChatGPT Work,由 GPT-5.6 驱动。
两家硅谷巨头在同一周,拿出了几乎一模一样的东西:一个你给它目标、它自己拆任务、查资料、跑几小时、最后交出成品——文档、表格、PPT、甚至一个能分享的网站——的智能体。
这不是巧合。当两家公司独立走到同一个答案,说明这个产品形态真的成立了。
但真正值得注意的是:这场仗的重点,已经从"谁的模型更聪明"变成了"谁占住你的工位"。
模型的差距,小到不值得吵了
先看数字。LMArena 上,Claude Fable 5 的 Elo 是 1508,Claude Opus 4.8 是 1503,GPT-5.6 Sol 是 1484。第一名和第三名差 24 分。
24 分是什么概念?同一个模型换一天跑两次,波动都可能比这大。在大多数真实任务里,这三个模型已经分不出胜负了。
更关键的是,你用的不是裸模型。你用的是"模型 + 提示词 + 工具 + 记忆 + 重试机制"的完整系统。一个稍弱的模型配上好框架,完全能在体感上打赢更强的裸模型。腾讯混元 Hy3 只激活 21B 参数,就能在部分 Agent 任务上打平旗舰——这就是证明。
当模型层的能力趋于同质,护城河就不在模型上了。
真正的护城河:你的文件、你的习惯、你跑了一半的任务
Anthropic 自己公布了一组数据,直接打碎了"AI Agent 只用来写代码"的刻板印象:在 120 万个匿名会话、覆盖 60 万+组织的样本里,业务流程类工作占 33.4%,内容创作占 16.4%,软件开发只占 8.7%。
超过 90% 的 Cowork 会话,是非编程的知识工作——写报告、做入职清单、做 PPT、对账。
这意味着什么?ChatGPT Work 和 Claude Cowork 争的不是开发者市场,是所有白领的工位。谁能让用户把文件、日历、项目追踪器、邮件都接进来,谁能让一个跑了三小时的任务继续在云端跑,谁就占住了那个位置。
一旦你习惯了在一个工作面上完成任务,你的文件、你的上下文、你定时跑的 Agent 任务全都在那里——迁移成本就高到几乎不可能换。
这就是"工位"的含义:不是聊天窗口,是你工作发生的地方。模型可以每周换一个,工位不会。
实测:谁更适合谁
凤凰网科技做了同期对比实测,结论很务实——没有绝对赢家,看场景。
速度上 Claude 领先。 同一个会议行程规划任务,Claude Cowork 6 分钟出结果,ChatGPT Work 花了 18 分钟。但 Claude 的产出偏"大而全"的通用模板,ChatGPT Work 虽然慢,交出来的是可交互的翻页卡片,带"低价值环节跳过清单"、展位评分标准,连采访邀约话术都生成了。
成品交付上 ChatGPT Work 胜出。 做《罗永浩使用指南》网页这个任务里,ChatGPT Work 做了定制化设计,匹配锤子发布会风格,自带打印样式、本地进度存储和一键复制,还能通过 Sites 功能一键发布为公开链接。Claude 交的是标准卡片流,模板感更重。
跨端能力 Claude 更成熟。 它的网页端和移动端支持完全云端运行,关掉设备后任务继续跑,支持定时任务。ChatGPT Work 在 Agent 额度消耗上更快,账单不够透明,合并功能对老用户也有阵痛。
一句话:需要从查资料到成品的完整链路,选 ChatGPT Work;需要整理本地素材、跨端跑长任务,选 Claude Cowork。按任务选,别按品牌选。
给开发者的三条建议
第一,别只盯模型 Elo,盯工作面。 选 AI 工具时,模型分数差 24 分已经不值得纠结。真正该问的是:这个工作面能接你的邮件、日历、代码仓库吗?任务能在云端持续跑吗?上下文会不会丢?这些才是每天用起来体感差距的来源。
第二,保持数据可移植。 两家都在抢你的工位,意味着锁定正在加深。文件、对话历史、Agent 配置,尽量导出并备份。别让一个跑了三小时的 Agent 任务成为你无法离开的理由。保持第二个工作面活跃,哪怕偶尔用用——关键时刻它能接上。
第三,模型和工位分开选。 最聪明的模型不一定要住在最方便的工位里。硬推理任务路由到 Fable 5,日常 Agent 循环丢给便宜的 Muse Spark 或 DeepSeek,最终交付在哪个工面上完成,取决于团队协作习惯,而不是模型分数。
工位之争,才刚开始
模型战争没有结束,但胜负已经不太重要了。GPT-5.6 和 Fable 5 在大多数基准上咬得很紧,国产开源 6 到 9 个月就能追上同性能段。当模型不再是壁垒,真正的壁垒就露出来了:谁占住了你每天打开的那个界面,谁留住了你跑了一半的任务,谁让你的习惯离不开它。
OpenAI 和 Anthropic 都在筹备 IPO。它们要讲给华尔街听的故事,不是"我们的模型比对方强 24 分",而是"我们每天有数百万用户在我们的工位上完成工作"。
对你来说这也是一个提醒:选 AI 工具,别只看模型排行榜。那个你每天花最多时间待在里面的界面,才是真正决定效率的地方。