人人都会AI编程

GLM 5.2:编程能力超越 GPT 5.5 的开源模型,价格只要 1/6

更新时间:2026-07-20

6 月 17 日,智谱上线并开源 GLM-5.2——7440 亿参数的 MoE 模型,MIT 协议,100 万 token 无损上下文。一个月以来,它在 SWE-bench Pro 编程基准上以 62.1 分超越 GPT-5.5 的 58.6,接近 Claude Opus 4.8 的 69.2。配合极低定价和全套开发工具,它可能是当前性价比最高的开源编程模型。

编程能力:进入第一梯队

GLM-5.2 在与编程密切相关的基准上表现突出:

  • SWE-bench Pro:62.1(GPT-5.5 为 58.6,仅落后 Opus 4.8 的 69.2)
  • FrontierSWE:74.4%,与 Opus 4.8 的 75.1% 仅差不到 1 个点
  • MCP-Atlas(工具调用):77.0(Opus 4.8 为 77.8,几乎持平)
  • Code Arena:开源模型第一;Design Arena:全球第一,超越 Claude Fable 5

开发者反馈集中在:项目级上下文能承载完整工程、长程任务执行稳定不跑偏、工程规范遵循可靠、移动端与客户端工程能力扎实。2 到 8 小时的长程全栈任务体感已接近 Opus 4.8。

需要注意的是,在 10 小时以上的极长自主任务(SWE-Marathon)上得分为 13.0%,与 Opus 4.8 的 26.0% 仍有差距,硬核长程任务仍建议选 Opus 4.8。

三种思考模式,按需控制成本

GLM-5.2 引入了 effort level 控制,让开发者在能力、速度、成本之间灵活切换:

| 模式 | 特点 | 适用场景 |
|------|------|---------|
| Non-thinking | 最快,零推理开销 | 日常补全、单文件任务 |
| High | 约 95% 峰值性能,约 50% token 开销 | 常规重构、一般调试 |
| Max | 完整能力,最高 85000 输出 token | 整库梳理、复杂 Agent 任务 |

实操建议:日常开发默认用 High,只在大规模重构时切 Max。1M 上下文同样按需使用——单文件补全无需开启,处理整个代码库或长程 Agent 任务时再启用,避免浪费 token。

架构创新:IndexShare 让长上下文真可用

多数模型的 1M 上下文"能塞下"但检索精度随长度急剧下降。GLM-5.2 提出了 IndexShare(索引器共享)——每四层稀疏注意力层复用同一个索引器,在 1M 上下文下将单 token 计算量压缩至 2.9 倍。配合多 token 投机解码,输出接受长度提升 20%,同时降低延迟。这意味着模型能在 80 万 token 处准确引用之前的接口定义和测试约定,而不是"假装记住了"。

ZCode:Claude Code 的国产桌面替代

智谱同步推出了 ZCode 3.0 桌面端编程 IDE,围绕 GLM-5.2 深度调优,内置兼容 Claude Code、Cline、Kilo Code 等主流开发工具。订阅从每月 12.6 美元起。实际体感上,ZCode + GLM-5.2 的组合被开发者评价为"最接近 Claude Code + Opus 4.8"的国产方案,价格约为 1/10。

价格与国产算力

GLM-5.2 的 API 定价为输入 8 元/百万 token(缓存命中 2 元)、输出 28 元/百万 token。美元计为输入 $1.40、输出 $4.40——分别是 GPT-5.5 的约 1/6、Claude Fable 5 的约 1/10。OpenRouter 上价格更低:输入 $0.95、输出 $3.00。MIT 协议可自由商用,自部署无额外成本。

另一个值得关注的事实:GLM-5.2 全部训练与推理均基于华为昇腾等国产算力完成,上线当天即适配 9 家国产芯片平台(昇腾、寒武纪、摩尔线程、海光、壁仞、沐曦、昆仑芯、平头哥、天数智芯),形成了一套不依赖 NVIDIA 供应链的完整技术栈。

小结

GLM-5.2 的核心价值是:MIT 开源 + 国产算力,把编程能力推到接近 Claude Opus 4.8 的水平,价格仅为竞品 1/6 到 1/10。如果你的团队需要自部署编程模型、不想绑定海外 API,或对 2-8 小时长程全栈任务有高频需求,GLM-5.2 是当前性价比最高的选择。10 小时以上的极长自主任务,Opus 4.8 仍是首选。