智谱正式发布 GLM-5, 从 “能敲代码” 变成 “能干工程”,瞄准的就是复杂系统工程和长周期的智能体任务
跟前代 GLM-4.5 比,GLM-5 的参数规模从 355B(激活 32B)涨到了 744B(激活 40B),预训练数据从 23T Token 推到了 28.5T。这次他们还引入了 DeepSeek 的稀疏注意力机制(DSA),在保留长上下文处理能力的同时压低了部署成本。这算是目前开源大模型圈里相对务实的做法。也就是模型变大了,但推理不至于太贵。
后训练阶段智谱也做了不少功夫。他们搞了一套叫 slime 的异步强化学习框架,核心目的就是提升 RL 训练的吞吐效率。强化学习对大模型来说一直是个"理想很丰满、落地很骨感" 的事情,训练成本高、迭代慢,slime 相当于在工程层面把这个瓶颈往前推了一步。
再说说跑分,在一系列公开基准上,GLM-5 在开源模型中基本做到了全面领先。SWE-bench Verified 拿到 77.8%,这个测的是真实软件工程任务的修复能力。Terminal-Bench 2.0 上达到 61.1%(使用修正后的数据集),接近 Claude Opus 4.5 的 61.8%。BrowseComp 这个考验浏览和信息检索的测试上拿了 62.0%,开源模型里最高。
最近比较热门的测评是 Vending Bench 2,让模型模拟经营一台自动售货机,跑满一整年,看最终账户余额。GLM-5 跑出了 4432 美元的成绩,跟 Claude Opus 4.5 的 4967 美元差距不大,远超 DeepSeek-V3.2 的 1034 美元。这个测试其实挺能说明问题的,因为它考的不是某个单点能力,而是长期规划、资源管理和决策一致性。而这些恰好是智能体场景最需要的东西。
但在 GPQA-Diamond 和一些纯推理任务上,GLM-5 跟 Gemini 3.0 Pro、GPT-5.2 还有一定的差距。智谱目前的策略应该是先在工程和智能体上发力,再提升推理能力。
对于普通用户而言,GLM-5 这次还推出了一项相当实用的功能:办公文档生成。模型现在可以直接把文字描述变成 .docx、.pdf、.xlsx 文件,不是那种简单的格式转换,而是带排版、带图表、的正式文档。
GLM-5 依然免费开源![手指比心] 支持 vLLM 和 SGLang 推理框架本地部署,也兼容华为昇腾、摩尔线程等国产芯片。目前 Ollama 也已经提供了免费云服务。
对于不想折腾部署的开发者,可以通过智谱的 GLM Coding Plan 在 Claude Code、Cline、Kilo Code 等主流编程工具里直接调用。目前 GLM-5 仅对 Max 计划用户开放,Pro 计划后续会逐步支持。需要注意的是,调用 GLM-5 比 GLM-4.7 消耗更多配额。Coding Plan 的定价从每月 3 美元起,Pro 计划 15 美元,对比同类产品算是比较有竞争力的。
普通用户也可以直接在 Z.ai 上免费体验 GLM-5 的对话和 Agent 模式。
我个人的一些看法:
根据智谱自己发布的测评报告,可以看出 GLM-5 并不是 “全面领先”,但在代码工程和智能体任务上确实做到了开源模型的前列,而且跟目前世界上闭源顶级模型的差距肉眼可见地缩小。
他们的策略也非常务实,并不在于模型跑分多高,而在于模型能不能真正嵌入开发者的工作流、帮人把活干了。从 Coding Plan 的工具生态布局,到文档生成的端到端交付,再到对评测数据集的严肃审查,这些事情加在一起,比单纯的 benchmark 数字更能说明这款新模型的实际价值。
最后要看实测的朋友,推荐一位靠谱的技术大 V @karminski-牙医 的测评:http://t.cn/AXt72FP1
#AI技术[超话]##智谱GLM-5##How I AI#
