人人都会AI编程

Codex被ChatGPT吞掉、Copilot接了Kimi:模型军备赛结束了,入口和上下文才是新战场

更新时间:2026-07-26

7月23日,钛媒体的一篇报道把过去三周AI编程工具赛道密集发生的几件事串在一起,结论很扎眼:没有一家还在赌"我的模型最聪明",争夺焦点全部转向"谁能占住入口"。

这不是空喊。6月底,开源项目OpenSquilla更新到0.4.0,内置了一个跑在设备本地的轻量分类器,能根据任务难度自动判断调用低成本模型还是高性能模型,官方数据显示综合Token成本降低60%到80%。7月3日,GitHub宣布开源权重模型Kimi K2.7 Code进入Copilot的模型选择器——这是Copilot历史上第一次把开源模型和闭源旗舰并列供开发者挑选。7月9日,OpenAI把独立运行近一年的Codex整体并入ChatGPT桌面端,做成Chat、Work、Codex三合一的超级应用,Codex每周活跃用户已超500万。7月18日,桌面级智能体OpenOcta发布v1.0.5,原生打通DeepSeek、豆包、通义等国产模型;终端编程Agent qwen-code同期更新到v0.19.8,继续坚持多协议开放路线。

把这些动作放一起看,一个结构性转折浮出水面:模型层的能力曲线正在变平,单纯拼模型的边际回报急剧下降,资源开始往上一层涌。

巨头收入口,开源放模型,殊途同归

两种策略看似矛盾,实则是同一场转折的两种应对。开源项目没有本钱在模型层竞争,索性放弃锁模型这条路,靠"谁都能接、足够便宜"吸引用户。巨头清楚模型优势撑不了太久,所以提前把用户往统一入口里收。

但"开放"和"收口"都不是字面那么简单。Copilot接入Kimi K2.7 Code看似给了更多选择,可这个模型是GitHub自己在微软Azure上托管的版本,企业版默认关闭,需管理员手动开启策略才能用。开发者以为拿到了自由,实际上锁定的对象从"必须用某个模型"换成了"必须通过某个入口才能用任何模型"。给不给、默认开不开、怎么计费,决定权一直在渠道方手里。

Codex并入ChatGPT是另一种锁法。把聊天、干活、写代码收进同一个窗口后,用户的切换成本不再是钱,而是认知成本——习惯在一个界面完成所有事的人,不会因为某个环节的模型不够强就转去一套陌生工具。重新适应工作流的代价,远比多付一点订阅费更让人却步。

但模型和入口,都不是你的胜负手

就在巨头抢入口的同时,7月24日的一批社区研究给出了一个让很多人意外的结论:大多数coding agent在真实仓库里失效,并非模型不行,而是上下文供给错了。

Chroma测了18个前沿模型,发现它们随上下文变长全面退化。ETH Zurich发现自动生成的超长CLAUDE.md会让任务成功率下降约3%,同时成本上涨20%以上。Sourcegraph的CodeScaleBench则直接点破:给对工具,比给长上下文更关键。

翻译成开发者的语言就是:你抱怨"AI又忘了我们用pnpm不用npm",十有八九不是模型记性差,而是你那句纠正要么被挤出去了上下文窗口,要么埋在8万token的构建日志里根本没被注意。模型有智能,但它没有"你的项目"的记忆——上下文窗口是个预算,不是记忆。每个读过的文件、每条命令的输出、每轮对话,都在花这个预算。

上下文工程:你真正该升级的那一层

既然窗口是预算,最高杠杆的事就是决定让代理看到什么、什么时候看到、怎么组织。这就是"上下文工程",2026年它正在取代提示词工程,成为AI辅助开发里最值钱、也最少有人刻意练习的技能。

第一,把规则写进会话能活下来的地方。 聊天里的纠正只帮一个会话;写进CLAUDE.md或AGENTS.md的一句话,帮每个会话、每个队友、永远。这两个文件在会话开始前就被加载,是你能控制的最持久的token。但别贪多——研究发现规则文件超过约200行,关键约束就开始被噪音淹没。只写代理无法通过读代码推断的内容:构建测试命令、不可妥协的边界、几条非显然的约定。代码风格交给ESLint,别让大模型干linter的活。

第二,警惕"lost in the middle"。 模型对开头和结尾的内容更敏感,中间的容易被忽略。把不可违反的约束放开头,把当前任务放结尾,参考资料放中间。有团队仅靠调整位置,代码风格违规率降了35%到40%——同样的规则、同样的模型,只是换了摆放顺序。

第三,别把一个巨型上下文塞给一个代理。 复杂任务拆给专门的子代理,每个只看它需要的东西。Claude Code的subagent、跨工具的AGENTS.md分层记忆架构(DECISIONS.md记录决策、KNOWN_ISSUES.md记录已知问题、RUNBOOK.md记录操作手册)都是这个思路。上下文隔离不是组织习惯,是上下文工程策略。

第四,长会话主动压缩,别等它被截断。 上下文吃紧时,用一句话总结进度替代粘贴完整历史:"已完成X、Y、Z,现在做W"比留着500行旧日志更有效。大功能之间开新会话,比在一个马拉松会话里硬扛更稳。

别追跑分,别被入口锁死

7月26日的社区日报记录了一个值得琢磨的趋势:用强模型做设计、弱模型做执行的多模型编排架构正在成为新范式——GPT-5.6编排、Gemini 3.6 Flash并行执行、Opus 5按需当顾问。但即便这套架构,也有开发者质疑:如果弱模型设计能力不足、问不到关键问题,"弱模设计强模顾问"就会失效,更合理的组合是"强模型设计、弱模型执行、强模型验收"。

这恰恰说明:编排的难点不在选哪几个模型,而在怎么把正确的上下文喂给正确的那个模型。模型不值钱了,入口被巨头把着,但上下文工程这件事,主动权还在你手里。把它当核心技能练,比追任何一份跑分榜都划算。