智谱GLM-5.3发布:后训练跑出编程与安全能力
8月14日,智谱旗下Z.ai正式发布GLM-5.3。这款模型没有更换基座,参数规模约7530亿,与上一代GLM-5.2基本持平,却在一天之内把Terminal-Bench 3.0成绩从4.6拉到28.3,翻了六倍。更让行业意外的是,它在网络安全评测里跑出了连智谱团队自己都没预判到的能力。
不换基座,全靠后训练Scaling
GLM-5.3沿用了GLM-5.2的基座模型,参数量约7530亿,与上一代基本一致。智谱把这次的能力跃升全部归功于”后训练Scaling”:更长的训练时间、更丰富的任务环境、更大规模的强化学习。官方技术报告显示,在真实终端环境任务Terminal-Bench 3.0上,得分从4.6跃升至28.3;在考察长程软件工程能力的DeepSWE v1.1上,从46.2提升至66.9。智谱称这两项均已位列开源模型第一。
为什么重要:这直接回应了7月Kimi K3以2.8万亿参数引爆行业后,外界对”GLM还有戏吗”的质疑。智谱给出的答案是,基座的智能上界远未触及天花板,堆参数的军备竞赛之外,还有一条后训练的路可以走。
编程能力逼近Claude旗舰
在智谱自研的Z.ai Code Bench评测中,GLM-5.3在High档位达到31.4%的准确率,超过Claude Opus 4.8最高档位的29.5%,且每任务平均输出约5万tokens,不到Opus 4.8的一半。不过在同一评测的Max档位下,GLM-5.3的34.5%仍低于Claude Fable 5的39.5%。在覆盖44种职业知识工作的GDPval-AA v2中,GLM-5.3得分1769,超过GLM-5.2的1508和Kimi K3的1682。
为什么重要:用更少的输出token换来更高的准确率,意味着同样的API预算能跑更多轮智能体任务,这对按token付费的开发者订阅模型冲击直接。
网络安全能力”意外涌现”
这是GLM-5.3最受关注的部分。智谱在训练中加入了漏洞挖掘数据与环境,原本只希望模型更擅长发现漏洞,结果它开始推理多阶段的攻击链,形成完整的利用方案。CyberGym得分84.5%,超过Anthropic Mythos 5的83.8%和GPT-5.6 Sol的83.6%;ExploitBench从24.4%翻倍到54.4%。
智谱披露,其模型已在269个开源项目中识别出2436个漏洞,其中1097个为中高危,53个已公开并分配CVE编号,其余2383个仍在保密期内等待维护者修复。
为什么重要:能力增长最快的方向,恰恰是离闭源前沿差距最大的方向。也正是这一”计划外”的涌现,直接导致智谱推迟开源,这在GLM系列里还是头一次。
开源推迟与定价
GLM-5.3目前通过Z.ai API与GLM Coding Plan开放,权重将在约两周的安全评估与加固完成后放出。定价沿用GLM-5.2的结构:输入1.40美元/百万token,输出4.40美元/百万token,缓存命中0.26美元。思考成为必选项,分低、中、高三档强度。
相关阅读:智谱GLM-5.2开源登顶:1M上下文+MIT协议改写全球格局;DeepSeek V4 Pro正式版上线:与Fable 5仅差0.1分。
GLM-5.3释放的信号很明确:模型竞争的胜负手正从”堆参数”转向”做后训练”,而安全能力一旦规模化,模型的可信度会成为比跑分更硬的门槛。接下来两周,行业真正要等的,是那批推迟放出的开源权重。