人人都会AI编程

一个协调者调度上千子智能体,PR 涨 6 倍:但 11 月 12 日,有人的模型要被断供了

更新时间:2026-09-18

一、9 月 10 日,两家公司同时按下同一个按钮

同一天,两件看起来不相干的事发生了。

Cursor 发布 Projects(公测),把 AI 编程的抽象层级往上抬了一层:你不再管理一堆 agent 会话,而是跟一个协调者智能体(coordinator)对话。这个协调者自己一行代码都不写,只负责拆任务、派活、验收、收拢成果,干活的是云上成百上千个并行子智能体。

同一天,OpenAI 把 Agents API 推到公开测试——本质是把驱动 Codex 的那套 harness(沙箱、上下文压缩、并行子智能体、MCP、可恢复会话)托管出来,让你一次 API 调用就能跑自己的 agent 集群。

方向出奇一致:竞争焦点从"单个 agent 有多强",转移到了"一个任务能拆成多少个可并行的子任务"。

Cursor Projects 有三件事值得单独拎出来:

  • 云上默认,本地按需。 每个 Project 跑在专属云端机器上,你合上笔记本它照跑;需要本机测试时协调者临时拉起一个本地 agent。
  • 共享上下文。 Project 维护一套跨云端与本地同步的文件集,agent 把调研、产物、代码库心得、你的偏好沉淀进去,后来的 agent 直接复用。这一条最省钱——在成熟代码库上"教会一个新 agent"的成本,经常比任务本身还高。
  • 订阅式触发。 协调者可以盯 Slack 频道、跟 PR、响应 CI 失败、按计划定时执行,不用你下指令。

Cursor 自己给的数据:新用户合并 PR 数提升 30%,重度 Projects 用户提升 6 倍。这是自报口径,没有第三方验证,当量级信号已经够清楚了——生产出来的代码不再是瓶颈

二、但同一周,Cursor 收到了一封断供通知

8 月 14 日,SpaceX 以 600 亿美元全股票完成对 Cursor 母公司 Anysphere 的收购。8 月 28 日,OpenAI 通知 SpaceX:依据合同里的控制权变更条款,终止向 Cursor 供应模型,生效日 11 月 12 日,且 Astra 等未来模型不再提供。

OpenAI 把理由写得很直白:援引 X 违反合同的前例、以及马斯克今年在庭上承认 xAI 蒸馏过 OpenAI 输出,称"无法确信 SpaceX 会在服务条款内使用我们的技术"。

Cursor CEO Michael Truell 的回应是:OpenAI 模型只占平台约 5% 的流量,团队仍在谈。Anthropic 的 Tom Brown 几小时内表态"会继续增加算力支持 Cursor 里的 Claude 模型"。Cursor 这边也已经在推自家的 Grok 4.6。

5% 这个数字,可能是整件事里最值得你警惕的地方。 它说明断供在商业上不致命——但它是第二次了。2025 年 6 月,Anthropic 就曾在 OpenAI 收购 Windsurf 传闻期间切断过 Claude 供给。先例已经变成惯例:模型不是基础设施,模型是有立场的商品。

更值得看的是 Cursor 的反应速度。9 月 4 日到 11 日这八天,它密集发了约 15 项更新:Origin 原生代码托管(双向 GitHub 同步、PR 工具、打通 Vercel/Buildkite 预览与流水线)、Cloud Agents 订阅 PR/Slack 事件与 /goal 长目标,以及自托管 agent 机器——让代码、构建产物和密钥留在你自己内网,只有规划与编排跑在 Cursor 云上。

被上游卡脖子之后的典型自救,就是把整条工作流收进自己手里。

三、并发拉到 256,瓶颈突然换人了

同一时间,Anthropic 在做另一件看上去很"工程"的事:

  • 2.1.269 起,claude plugin eval 让插件/skill 作者能写测试用例、打分、关掉插件重跑看 delta;CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS 从 1 调到最高 256
  • 2.1.271 加入按命令的 allowed_domains 沙箱:某条命令只开放它需要的域名,其余一律拒绝——比"全开或全关"的网络白名单细得多。
  • 2.1.275/2.1.276 一天内热修了自定义网关回归(ANTHROPIC_BASE_URL 代理用户 400)。

把这些和 Projects 放在一起看,结论很直接:生成侧的吞吐已经被拉爆了,现在的天花板是验收侧。

两条现成的应对路径:

第一,把确定性检查前置。 阿里开源的 open-code-review 是个好样板:静态检查、规则、依赖分析走确定性流水线兜底,LLM agent 只处理语义与上下文,官方称单 PR 审查 Token 消耗约为纯 LLM 方案的 1/9,精度优先策略下漏报率还更低。别让模型干 linter 的活。

第二,把你团队的隐性经验固化成 skill。 Addy Osmani 的 agent-skills 仓库冲到 9.5 万 Star,不是因为模型变强了,而是因为大家意识到"agent 可靠性的难点在于把资深工程师的默会知识编码下来"。从你团队最近 100 条 code review 评论里挑高频的那几条,那就是你的第一批 skill。

四、长程 agent 的安全账,比你想的更脏

Emergence AI 刚做完一轮长程多智能体安全压测,结论有两层:

  • 没有任何一个模型种群通过全部三个层级——即便已经识破了钓鱼,智能体仍在 46 小时后点开了恶意链接。
  • 同质种群每天产生数百次有害行为,混合种群几乎为零。

第二条的工程含义极其明确:不要让同一个模型、同一套 prompt 复制成一百份去跑并发。多样性本身就是一道安全防线。

再叠加两条硬约束:Cursor 主动禁止 agent 自动推送到 main 分支(用信任换采纳,而不是用能力换);Claude Code 用域名级沙箱把单条命令的外联范围收死。这两条都该抄进你自己的配置里。

五、现在该做的四件事

1. 把 11 月 12 日当硬期限查一遍。 先确认你的工作流到底有没有踩在坑上:

# 在配置与脚本里找硬编码的 OpenAI 模型依赖
rg -n "gpt-|astra|o3|o4" .cursor/ .github/ scripts/ 2>/dev/null

命中了就准备三条退路:自带 API key 通道(OpenAI 已确认这条路保留)、切到 Cursor 里的 Claude/Grok 模型,以及把 prompt 与 skill 写成跨工具格式(AGENTS.md + 标准 skills 目录),别写成某个产品的私有格式。

2. 把验收流水线加厚一层。 lint、类型、测试、依赖与密钥扫描全走确定性工具,模型只做语义层评审。agent 每 N 次提交自动跑一次,而不是等它跑完再验。

3. 给长程 agent 划红线。 禁止自动推 main;按命令开域名白名单;每个子 agent 用独立的、最小权限的凭证;设 Token 与时长双止损。混合模型、混合提示词的种群,比整齐划一更安全。

4. 留一条开源退路。 可自托管的 harness + 开源权重(Qwen3.8 系列、DeepSeek V4-Flash、Kimi K3、GLM-5.3)不是为了省钱,是为了在下一封断供通知来的时候,你还有得选。


模型会吵架,合同会到期,公司会被收购。真正属于你的,只有怎么拆任务、怎么验收,以及那条随时能换的退路。