宝玉xp
26-08-14 13:51 微博认证:前微软Asp.Net最有价值专家 2025微博年度新知博主 科技博主

智谱 AI(Z.ai)今天发布了 GLM-5.3,和 GLM-5.2 共用同一个基座模型,所有提升都来自后训练阶段的强化学习(RL)。

【1】编程:开源阵营里最强,但离闭源前沿还有距离

GLM-5.3 在多个编程基准上拿到了开源模型(开放权重模型)的最高分。比如 Terminal Bench 3.0,GLM-5.2 只有 4.6 分,5.3 跳到了 28.3。DeepSWE v1.1 从 46.2 涨到 66.9,Agents' Last Exam 从 23.8 到 28.5。在智谱自建的 Z.ai Code Bench 上,GLM-5.3 在 Max 级别用大约 7.5 万 Token 就达到了 34.5% 的完成率,而 GLM-5.2 用了 9.6 万 Token 才拿到 23.4%,能力和效率同时提升。

不过对照闭源模型,差距仍然存在。在 Z.ai Code Bench 上 Fable 5 达到 39.5%,ExploitBench 上 Fable 5 拿了 78.0 而 GLM-5.3 是 54.4。整体格局是:开源第一,全局第二梯队。

【2】网络安全能力"涌现":他们自己也没完全预料到

智谱说,他们在后训练中加入了漏洞发现相关的数据和环境,本来预期模型会在识别漏洞方面有所提升。结果超出了预期:模型不只是在找漏洞,还开始自主规划完整的漏洞利用链条。

数字上看,CyberGym(白盒源码审计)GLM-5.3 拿了 84.5%,全场最高,超过 GPT-5.6 Sol 的 83.6% 和 Fable 5 的 83.8%。ExploitBench(要求对真实漏洞进行更深层的利用推理)从 GLM-5.2 的 24.4% 跳到 54.4%,翻了一倍多。ExploitGym(限时完成漏洞利用任务数量)从 29/39 涨到 105/130。规律很明显:越靠近利用链的后端,进步越大。

智谱用了"涌现"(emergent)这个词,意思是这个能力不是他们专门去训练的,而是在扩大 RL 规模的过程中自然冒出来的。这个说法如果属实,对 AI 安全领域是个需要关注的信号。

【3】在 269 个开源项目中发现 2,436 个真实漏洞

跑分只是一面。更引人注意的是,智谱说从 GLM-5.2 开始就和国内安全团队合作,用模型扫描真实代码库。经专家审核和去重后,模型在 269 个开源项目中发现了 2,436 个漏洞,其中 1,097 个是中高危级别。涉及的项目覆盖了操作系统内核、浏览器引擎、网络协议等核心基础设施,有些漏洞在代码里藏了几十年,最老的一个可以追溯到约 40 年前。

目前 53 个漏洞已公开披露,2,383 个仍在保密期。智谱还上线了一个公开的漏洞披露追踪页面(Z.ai Security Disclosure Ledger),持续更新进度。

这和今年 4 月 Anthropic 公布 Claude Mythos 发现大量零日漏洞的路径很像,但有一个关键区别:Mythos 被美国政府严格限制了使用范围,只对少数审核过的安全机构开放。而 GLM-5.3 的权重将在两周后公开发布。一个能力接近的漏洞发现引擎,即将以开源形式进入公共领域。

【4】技术栈:用 slime 框架不换底座只加训练

所有这些提升背后的技术逻辑:不换基座模型,靠扩大后训练规模。

具体来说,智谱在 GLM-5.2 时期搭建了三个核心组件:IndexShare(长上下文处理)、SAO(长周期任务的 RL 算法)、以及开源的 slime 框架(大规模异步训练基础设施)。GLM-5.3 的做法就是在这套栈上继续堆:更多环境、更多样的任务、更多训练计算。

训练环境的设计也在变。新的环境不再像编程练习题,而是模拟资深工程师的真实工作场景,有些任务相当于一个有经验的工程师需要干好几天的活,比如在一个完整的 ML 基础设施环境里诊断训练瓶颈、实现优化、跑实验、交付可验证的端到端加速。

为了规模化生产这些训练环境,智谱还搭建了自动合成环境的流水线:研究智能体从真实工作中提取任务模式,生成可执行的长周期环境,评判智能体再验证任务是否可解。这套流水线仍然需要人工参与,但让环境的生产效率提高了很多。

【5】怎么用

API 已经上线,所有 GLM Coding Plan 用户都可以使用,支持 ZCode、Claude Code、OpenCode 等编程智能体工具。GLM-5.3 不再支持关闭思维链(thinking),只能在 low、high、max 三个思考级别之间切换。编程任务推荐用 max。

计费改为积分制,非高峰时段(工作日 14:00-18:00 北京时间以外的所有时段,包括周末)消耗标准积分的 50%。通过 ZCode 使用还能享受 98% 以上的缓存命中率和限时 1.5 倍额度加成,叠加后相当于标准额度的 180%,活动截止到 8 月底。

模型权重两周后公开发布。

官网:http://t.cn/AXNTP1jv

发布于 美国