编程模型的下半场:智谱 GLM-5.3 凭 84.5% CyberGym 跑出「能挖别人 bug」的开源编程模型

编程模型的下半场,不是「写更多代码」,而是「能发现别人写错的代码」。 智谱 8 月 14 日发布的 GLM-5...

编程模型的下半场,不是「写更多代码」,而是「能发现别人写错的代码」。

智谱 8 月 14 日发布的 GLM-5.3 把这件事明面化了:它在不换基座、纯靠后训练 Scaling 的情况下,Terminal-Bench 从 4.6 跃至 28.3、DeepSWE 升至 66.9、对比 GLM-5.2 在内部 Z.ai Code Bench 上提升约 50%,两周内开源权重。一句话总结:这是当下编程能力最强的开源模型,且这个「最强」不只是写代码,而是顺带把网络空间安全也「涌现」出来了。

数据点:从写代码到「挖漏洞」

GLM-5.3 在白盒网络安全基准 CyberGym 上拿到 84.5%,直接追平 Anthropic 的闭源旗舰 Mythos 5。截至公开发布时,模型在真实环境中累计发现 2436 个漏洞,其中 1097 个被评定为中高危,覆盖内核、浏览器、DNS 等 269 个开源项目。这不是「代码补全」副业能跑出来的成绩单——它需要在理解大型代码项目上下文的同时,主动推理攻击面,而这些技能在传统编程基准里压根不考。

更有意思的是它把「编程模型」与「安全模型」打通这件事写进了产品叙事。智谱同步推出「开源的盾」计划,宣布对重点开源项目免费提供安全审计,把前沿安全能力当作「应开源而非闭源特权」的公共物品。这是一种新的定位:大模型公司不再只是给开发者写工具,而是把模型变成开源生态的「免疫系统」。

限制:CyberGym 不是真实世界

需要给数字降温。CyberGym 是白盒、有 ground truth 的评测集,真实漏洞的验证仍然依赖 CVE 编号、人工复现与披露流程。模型能不能在「零日漏洞挖掘」这种长链路任务里保持同样的得分,目前没有任何公开证据。换句话说,GLM-5.3 在「已知有洞的地方找洞」这件事上做得很好,但「在没人觉得有洞的地方挖出新洞」仍是另一个量级的工程。

另外,84.5% 这个数字本身,要看作「编程能力达到一定程度后自然涌现出的副产物」,而不是 GLM-5.3 的设计目标。它不是专门为安全审计训练的模型,只是代码理解足够深之后,理解漏洞就变成顺路的事。

它改变了什么

编程模型赛道的「下一个竞速点」被悄悄换掉了。过去六个月,各家卷的是「能不能跑通 SWE-Bench、HumanEval、LiveCodeBench」。从 GLM-5.3 开始,这条赛道的边界被推开:一个模型能不能既写代码、又能审代码、还能发现别人代码里的漏洞,将成为新的能力分水岭。

更宏观地看,这意味着开源模型正在从「性能追赶」转向「能力外溢」。开源闭源的差距不在 Coding 本体,而在 Coding 之外的副产物——安全、运维、文档、可观测性。GLM-5.3 跑出了「代码智能体的护城河不在写,而在审」的第一条样本线。

接下来 12 个月,值得盯三个验证点:第一,DeepSeek-V5、Qwen3.9、Kimi K4 会不会也把 CyberGym 类基准写进发布材料;第二,「开源的盾」计划能否在 6 个月内把 GLM-5.3 的安全审计能力商业化打包成 SaaS;第三,Coding 能力 + 安全能力的「双榜冠军」会不会成为下一代模型默认发布姿势。

写代码的模型已经不少了。能审计别人代码的开源编程模型,这是头一回正式摆到台面上。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1