Kimi K2.7 Code发布:token消耗降30%,坦诚面对GPT差距的国产编程模型
6月12日,月之暗面正式发布Kimi K2.7 Code编程大模型。相比上一代K2.6,新模型在代码基准测试中最高提升31.5%,平均token消耗减少30%,并坦诚标注自身与GPT-5.5、Opus 4.8仍存在约10分的量化差距——这在国产大模型中极为少见。
长上下文编程:token消耗直降30%
Kimi K2.7 Code最核心的升级落在长上下文编程场景。官方数据显示,新模型在三项代码基准测试中均有显著提升:Kimi Code Bench v2提升21.8%,Program-Bench提升11%,MLS Bench Lite提升31.5%。
提升的来源并非简单的参数堆叠。月之暗面重点解决了AI编程模型在长程任务中的过度思考问题——即模型在复杂任务中反复推理、产生大量无效token的现象。优化后,平均token消耗减少30%,直接降低了开发者的调用成本。标准版定价维持不变:1M token输入6.5元、输出27元,相当于同等预算下可多完成30%的编程任务。
这对实际开发场景意味着什么?以一个需要跨多个文件修改的重构任务为例,K2.6可能需要消耗数十万token反复确认修改范围,而K2.7 Code能更精准地锁定目标,减少冗余推理步骤。
Agent自主化能力:编程之外的延伸
除代码生成外,K2.7 Code在Agent自主执行能力上也有约10%的提升。在Kimi Claw 24/7 Bench、MCP Atlas和MCP Mark Verified三项基准测试中,新模型在工具调用、任务规划和自主决策方面的表现均优于前代。
这并非偶然。当前AI编程的竞争焦点已从能不能写代码转向能不能自主完成复杂任务。一个AI编程助手如果只能按指令逐行生成,那它只是高级补全工具;只有当它能理解需求、规划步骤、调用工具、验证结果,才算真正进入Agent时代。
月之暗面在Agent方向的投入,与同期6月12日开幕的北京智源大会遥相呼应——智源研究院同日发布全球首个通用世界基座模型悟界·Physis-v0.1和Agent基础设施FlagOS 2.1,整个行业正在从模型竞赛转向智能体落地。
坦诚标分:60分对标70分的差距在哪
月之暗面在发布中做了一个罕见操作:官方量化评分显示,GPT-5.5和Opus 4.8在编程领域约为70分,K2.6约50分,K2.7 Code刚过60分。
这种坦诚在国产大模型中并不多见。更多厂商习惯在单个评测项目上寻找超越点,然后宣布全面对标甚至超越。月之暗面选择公开差距,背后有两层逻辑:一是K2.7本身定位为小版本迭代而非年度大更新,真正的重头戏K3才是对标旗舰的武器;二是在开发者社区中,坦诚比包装更能建立长期信任。
从50分到60分,进步幅度为20%;但从60分到70分,难度会指数级增加。K3能否真正缩小这10分差距,将决定月之暗面在AI编程赛道的最终站位。
高速版将至:6月16日5倍速输出
6月16日,月之暗面将推出K2.7 Code高速版,输出速度约为普通版的5-6倍:常规编程场景约180 token/s,短上下文可达260 token/s。定价为普通版的2倍。
这个定价策略值得关注。5-6倍速度提升只收2倍价格,意味着单位token的实际成本反而下降。在OpenAI考虑大幅降价抢夺Anthropic客户、全球AI推理成本持续下行的背景下,月之暗面的高速版定价既是对趋势的顺应,也是对开发者付费意愿的一次试探——当速度不再是瓶颈,AI编程工具的竞争将回归到代码质量本身。
AI编程赛道在2026年6月进入精雕阶段:不再比谁参数更多、跑分更高,而是比谁更省token、更少出错、更快交付。Kimi K2.7 Code用30%的消耗削减和坦诚的差距标注,给出了一个务实的迭代样本。
评论已关闭。
[…] 做一个简单对比:DeepSeek V4虽然也搭载了昇腾950平台,但其训练仍然依赖混合算力方案。GLM-5系列是目前国产大模型中少有的、从预训练到微调全程跑在国产芯片上的头部模型——这个”首个”的含金量,在当前地缘格局下会越来越重。本周Kimi K2.7 Code发布同样在编程能力上取得了显著突破,但智谱选择了一条更”硬核”的路:把供应链安全直接捆绑到模型迭代里。 […]