AI AI工具情报站
AI资讯ai-models

编程能力开源第一,并涌现网络安全能力

公众号:智谱(GLM)2026-08-14T05:31:04.000Z

核心亮点

智谱发布 GLM-5.3,它沿用与 GLM-5.2 相同的基座,但通过"极致的后训练 Scaling"把智能上限进一步抬高。最亮眼的成绩在编程:较上一代提升 50%,在 Terminal Bench 3.0 等公开基准中拿到开源第一,并已逼近 Claude Code 的水平。更让人意外的是,模型在网络安全任务上"涌现"出可观能力——白盒代码审查持平 Mythos 5,CyberGym 测试得分 84.5%。一款通用模型,正长出了安全领域的牙齿。

具体能力或事件经过

GLM-5.3 的编程实力不是靠换更大的基座,而是靠后训练阶段的精细打磨:用更多高质量代码、工具调用与 agent 轨迹数据去"喂养"同一套底座,把已有潜力逼出来。这也解释了为何它能在终端操作、长程编码任务上追平闭源强者。模型权重将在两周后开源,而从发布起就已上线 ZCode、AutoClaw 等工具,开发者可以立刻在工作流里用起来。这种"先可用、后开源"的节奏,兼顾了落地与安全评估。

技术细节

"后训练 Scaling"指的是在固定基座之上,持续扩大后训练的计算与数据规模,以换取智能提升。它在编程上的体现,是更强的函数级理解、跨文件改码与命令执行能力。安全侧,白盒代码审查要求模型读懂源码并发现漏洞,GLM-5.3 与 Mythos 5 持平,说明其代码语义理解已具专业水准;CyberGym 84.5% 则衡量其在仿真攻防环境中的表现。需要提醒的是,安全能力越强,越要配套使用规范与护栏。

与竞品对比

在开源编程模型里,GLM-5.3 直接对标 DeepSeek、Qwen 以及 Meta 的 Llama 系列。50% 的代际提升与开源第一的标签,让它在中文与工程场景颇具号召力。对比闭源的 Claude Code,它已逼近而非超越,但开源意味着可审计、可私有化、可改,这正是企业看重的地方。说白了,智谱想用"开源里最能打代码"的称号,巩固国产模型在开发者心中的位置。

行业影响或适用场景

对国内开发者与企业,GLM-5.3 提供了一个强且可私有部署的编程与安全底座,适合代码助手、DevSecOps、自动化审计等场景。对行业,模型自带安全能力是双刃剑:提升防御效率的同时,也可能被误用,因此开源前的评估与后续的使用边界显得重要。