AI AI工具情报站
模型动态智谱:研究(网页内嵌数据)

编程能力开源第一,并涌现网络安全能力

📰 智谱:研究(网页内嵌数据)📅 2026-08-14T06:00:00.000Z

一句话总结

智谱 GLM-5.3 在同一基座上靠极致后训练把编程能力顶到开源第一,还顺手长出了白盒代码审计和网络安全实战能力,完整权重将在两周内免费开源。

这次到底升级了什么

说白了,GLM-5.3 并没有换底座,它和前一代 GLM-5.2 用的是同一个基座模型,真正的升级发生在后训练阶段。智谱把这一波做法称为"极致后训练 Scaling"——简单讲,就是在不增大模型规模的前提下,疯狂堆对齐数据、强化学习样本和长推理链,把模型智能的上限往上顶。这种思路在当前基座红利逐渐见顶的大环境下,越来越成为头部厂商的共识:与其烧钱堆参数,不如把已有的好模型在后训练环节"盘"得更聪明。

编程能力涨了多少

官方给出的最亮眼数字是:编程能力较前代提升 50%。但真正有说服力的是第三方基准——在 Terminal Bench 3.0 这种模拟真实命令行任务的评测里,GLM-5.3 拿到了"公开可免费使用模型"中的第一名。这里要划个重点:它没去碰 GPT-5、Claude Opus 那种闭源巨无霸的总榜,但在"能白嫖、能本地部署"的阵营里,它现在是头号选手。对一个开源模型来说,这个定位其实比笼统地喊"接近 GPT"更有意义,因为它直接对应了开发者最关心的场景:我能不能免费、合规地用它干活。

顺便长出了安全肌肉

有意思的是,这次后训练不光喂代码,还掺了大量安全任务数据。结果模型在白盒代码审查(white-box code review,让模型像资深工程师一样通读你的源码仓库、定位漏洞和坏味道)上,表现追平了同级别的 Mythos 5;在 CyberGym 这个模拟真实攻防的测试里拿到了 84.5 分。一个原本主打编程的模型,现在能帮你审代码、挖 bug,甚至在红蓝对抗里当辅助,这种"编程 + 安全"的组合在开源阵营里确实不多见。

跟谁比,怎么选

横向摆一摆,开源编程这条赛道现在的常客是 Qwen3.8 系列、DeepSeek 的 V3 系,以及闭源但提供免费额度的 Gemini 和 Claude。GLM-5.3 的打法很明确:不拼参数规模,拼"同一底座上用后训练把单项能力拉满"。对国内开发者来说,如果你的需求是"中文友好 + 编程强 + 未来能本地部署",那 GLM-5.3 开源之后,会是 Qwen 之外一个非常顺手的备选。它和 Qwen 不是替代关系,更像是互补:一个偏通用多模态,一个在编程与安全垂直项上更锋利。

怎么用,什么时候能用

落地节奏很清晰:即日起已经上线 ZCode、AutoClaw 等工具,开箱即用;正式的 API 调用接口"很快"上线(这是智谱的原话,具体日期待定);最关键的一条——完整模型权重将在两周内开源,而且免费、可商用。换句话说,你想在本地或者私有云里跑一个"编程 + 安全"双修的开源模型,最多再等两周。

我的看法

我觉得 GLM-5.3 最值得说的,不是那个 50% 的涨点,而是它又一次验证了后训练 Scaling 还能挖出不少油水。两周后权重一放出,中小团队和个人开发者等于白捡一个能本地部署的编程助手,这比任何发布会噱头都实在。当然不足也得说:84.5 的 CyberGym 离"能独立当安全工具用"还差一口气,真要拿它做生产环境的代码审计,建议还是人机协同,别把关键决策全交给它。