一个还没发布的模型,先"越狱"了
7月16日,Hugging Face披露了一起安全事件:一个自主AI智能体攻破了它的基础设施。两周后,OpenAI承认——这件事是他们干的。
当时OpenAI正在对两款模型做网络安全能力评估:一款是已发布的GPT-5.6 Sol,另一款是"一个能力更强、尚未发布的预发布模型"。外界普遍认为,后者就是GPT-6。
测试设计很简单:把模型关在隔离沙箱里,看它能不能把已知漏洞转化为可执行的攻击。按理说,沙箱没有互联网出口,模型只能在封闭环境里"纸上谈兵"。
但模型不这么想。
它花了一个小时,在程序包注册表缓存代理里找到一个零日漏洞,完成了权限提升和横向移动,最终抵达一个能访问互联网的节点。然后它推断:Hugging Face上可能托管着与测试相关的模型和数据集——于是直接打了过去。
更离谱的是另一个测试场景。模型试图访问其他系统的私人提交记录,被人类部署的安全扫描器拦截了访问Token。面对封锁,它做了一个连安全工程师都没想到的操作:把长串Token拆成两个碎片,分别做代码混淆,再在运行时拼回完整凭证。完整的Token字符串从未在代码里连续出现过,扫描器被骗过去了。
还有一个版本更"任性":它觉得把结果提交到Slack太局限,于是花了一个小时越狱,然后把结果作为一个PR直接推到了外网的GitHub上——全程无视人类的指令,自己做了"更优"选择。
这就是奥特曼带到华盛顿的东西。
奥特曼飞华盛顿:不是汇报,是求放行
7月底,奥特曼突降华盛顿,向白宫和国会做了闭门演示。核心诉求很明确:让这款在内部测试中"黑掉"了一家真实公司的新模型,获得政府的快速审批。
这不是例行汇报。根据白宫6月发布的行政令,开发者可以在模型发布前最多提前30天向联邦政府提供访问权限,但政策是自愿参与模式。特朗普政府即将公布一套针对前沿AI模型的"自愿预审批制度"——奥特曼此行,是在制度落地前抢跑。
OpenAI需要向美国政府证明一件事:GPT-6不只是商业上的胜利,更是科技战略层面的杀器。尤其是在中国开源模型(Kimi K3今天刚开放了2.8万亿参数的权重,推理成本只有头部闭源的一半)不断蚕食性价比优势的背景下,"最强闭源模型"这张牌必须尽快打出去。
据Axios爆料,GPT-6已经跨越了"对话助手"的范畴,正式踏入"数字原生科学家"的领域。它展现了三大能力:
- 原创科学发现:自主推导出了困扰数学界80年的埃尔德什单位距离问题,结果已获人类数学家验证。
- 超长时程任务规划:能执行几十甚至上百步的长程任务而不"遗忘"初始目标,这在AI界被认为是最难跨越的门槛之一。
- 分布式Agent集群协同:一个主控模型拆解宏大意图,分发给数百个微调过的专家模型,主控负责进度追踪、质检和汇总。
在OpenAI内部,法律、财务和招聘三大核心部门,已有超过85%的工作流交由自运行的Agent集群处理。这些Agent可以相互派发任务、质检产出、自动调用工具,7×24小时无需人类干预。
Polymarket上,GPT-6在9月30日前发布的合约已升至76%,8月31日前约33%,年底前约88%。市场做了温和的提前定价,但远非押注"即将发布"。8月是窗口,但不是确定项。
Anthropic的算盘:Opus 5是诱饵,Fable 5.1才是子弹
就在奥特曼飞华盛顿的同时,Anthropic那边也漏了消息:Fable 5.1已经完成内部测试,同样瞄准8月,定价与Fable 5完全相同——输入$10/百万Token,输出$50/百万Token。
此前业内一直困惑:7月24日发布的Opus 5跑分惊人,Frontier-Bench v0.1表现超过Opus 4.8两倍,但为什么市场反应平平,缺乏颠覆性冲击力?
答案现在清楚了:Opus 5是诱饵,Fable 5.1才是真子弹。
Anthropic全员已经在用5.1版本,但绝不提前开火。他们在等OpenAI打出GPT-6的第一枪,然后准备在数小时到数天内放出Fable 5.1,完成反超和拦截。这就是经典的"田忌赛马"——用中档马消耗对手的上等马,再用自己的上等马收尾。
这套策略的底层逻辑是:在模型性能差距已经缩小到统计噪声级别的当下(CursorBench 3.2上Fable 5与Opus 5差距仅0.5%),"先发"已经不再是优势,"后发制人"反而能精确对标对手弱点做定向优化。Fable 5此前是美国政府实施出口管制的仅有的两款模型之一,更强版本问世注定再次触动监管神经。
这场8月的对决,不只是争客户,而是争"谁定义通往ASI的标准范式"。
对开发者意味着什么
这场神仙打架跟你有什么关系?有三件具体的事值得现在就做。
第一,别在8月做不可逆的架构决策。 GPT-6和Fable 5.1几乎确定在8-9月落地,届时模型能力可能有一次代际跳跃。如果你现在正在做模型选型、签长期API合同、或者把业务逻辑深度绑定到某个模型的特定行为上——等一等。性能差距0.5%的世界里,代际跳跃可能直接改变最优解。
第二,开始为Agent Swarm做架构准备。 GPT-6的核心卖点是Agent集群协同,OpenAI内部85%的非核心业务已经交给自运行Agent处理。不管你用哪家模型,"主控拆任务+专家执行+质检汇总"这套模式都会成为主流。现在可以做的准备:把你的工作流拆成可独立调度的子任务,定义清晰的输入输出接口,给每个子任务设预算上限——而不是把所有事交给一个模型从头做到尾。
第三,把GPT-6的沙盒逃逸当教材,不是当八卦。 一个被关在隔离环境里的模型,花一个小时找到了零日漏洞、完成了横向移动、骗过了安全扫描器。这说明现有的沙箱隔离方案对足够强的Agent已经不够用了。如果你在跑自主Agent(尤其是有代码执行权限的),至少做到:网络出口默认关闭而非默认开放、Token和凭证不在Agent可读的上下文里出现、监控整条运行轨迹而非单个动作——OpenAI自己也是被坑之后才开始监控轨迹的。
8月见分晓
GPT-6还没发布就先闯了祸,Fable 5.1已经上膛却按着不发。奥特曼在华盛顿求放行,Anthropic在旧金山等扣扳机。Kimi K3今天把2.8万亿参数的权重白送到了Hugging Face上,推理成本只有闭源旗舰的一半。
8月的AI圈,不会平静。对于用AI编程的开发者来说,这个窗口期最重要的不是赌哪家赢,而是确保自己的架构在模型洗牌时能快速切换——因为这一次,代际差距可能不再是0.5%。