7 月 16 日,月之暗面发布 Kimi K3,2.8 万亿参数,成为全球最大的开源模型。更值得关注的是,在 Code Arena 编程盲测榜单上,K3 以 1679 分位列全球第一,超过 Claude Fable 5 和 GPT-5.6 Sol——这是开源模型首次在这项百万级用户参与的编程评测中登顶。如果你日常用 AI 辅助编程,以下信息直接影响选型。
编程能力:开源首次反超闭源
K3 的 MoE 架构在 896 个专家中每次激活 16 个,基于 Kimi Delta Attention 和注意力残差技术构建,整体扩展效率较 K2 提升约 2.5 倍。
关键评测数据:
- Code Arena(前端编程):1679 分,全球第一,在 7 个细分领域中 6 项第一。
- LiveCodeBench:82.4%,显著高于 DeepSeek V4 Pro 的 74.6%。
- BrowseComp(长上下文检索):91.2 分,当前最佳,得益于 100 万 token 上下文窗口。
官方工程验证也颇具说服力:K3 连续自主运行 48 小时完成了一颗 4mm² 芯片的构建与验证;约 2 小时内交叉验证 20 余篇论文并生成 3000+ 行 Python 分析代码。对于需要长程自主编程的场景,K3 展现了 Agent 级别的执行力。
怎么用:三种接入方式
- API:通过 platform.kimi.ai 调用,编程场景缓存命中率超过 90%(Mooncake 分离式推理架构)。
- OpenRouter:模型 ID 为
moonshotai/kimi-k3,适合已在用多模型的团队统一接入。 - 自部署:完整权重将于 7 月 27 日开放。但官方推荐在 64 个及以上加速器的超节点上部署,实际能负担的机构有限,个人和小团队建议优先用 API。
实用建议:设好 token 预算
K3 始终以最大强度推理,推理 token 计入输出额度。这是实操中最容易踩的坑:
- completion token 预算建议设为 8192 以上。4096 的上限往往在推理链跑完前就耗尽,可见答案还没开始输出。
- 利用缓存:编程场景缓存命中率高,把稳定的项目前缀(代码规范、工具说明)固定下来可显著降本。命中时输入价仅 2 元/百万 token,未命中为 20 元。
成本:强,但不便宜
K3 的输出价格为每百万 token 100 元,约为 K2.7 Code 的 4 倍,已进入全球顶尖模型定价区间。第三方测算单任务成本约 0.94 美元,与 GPT-5.6 Sol 接近,约为 Claude Opus 4.8 的一半。
但要注意:K3 在评测中生成约 1.3 亿输出 token,是同类推理模型中位数的两倍。Agent 密集型工作流的实际单任务成本可能明显高于标称价格。100 万 token 上下文也分层开放,仅高阶会员可用全量,普通用户限 256K。
什么时候选 K3
- 适合:长程复杂编程、前端开发、需要自主多步骤执行的任务、需要 100 万 token 上下文的代码库分析。
- 谨慎:简单代码补全、对延迟敏感的实时交互、预算受限的高频调用——这些场景 K2.7 Code 或其他轻量模型性价比更高。
- 留意:复杂任务推理可能耗时较长(实测前端项目生成近 1 小时),UI 产出有模板化倾向,需要人工介入调优。
小结
K3 的意义在于:开源模型首次在编程能力上反超顶级闭源模型,且权重即将开放。对开发者而言,它是长程复杂编程任务的新选项,但"最强"不等于"最合适"——按任务复杂度、延迟和成本综合选型,才是务实做法。