宝玉xp
26-08-20 07:12 微博认证:前微软Asp.Net最有价值专家 2025微博年度新知博主 科技博主

智谱联合创始人唐杰老师关于 GLM 5.3 以及模型训练的一些分享:

智谱 GLM-5.3 没有换基模底座,纯靠后训练让编码能力提升 50%。

GLM-5.3 模型的底座是 GLM-5.2,约 743B 参数的混合专家(MoE)模型,每次推理只激活约 40B 参数。团队花了一个月,在长周期环境中做强化学习,编码能力比 GLM-5.2 提升了 50%。

这里解释一下 MoE:传统模型每次推理要跑完所有参数,MoE 相当于把模型拆成一群“专家”,每次只调用其中几个,推理速度更快、成本更低。

推文中特别区分了两个概念:
1. 总参数量决定模型学习了多少知识
2. 激活参数量和有效深度决定模型能想多深。

比如说,让模型去找安全漏洞,主要是依赖的是推理能力,能把一条二十步的推理链完整走到底,相对来说各种安全数据库是次要的。

至于为什么不换底座也能大幅提升呢?

AI 模型的扩展(scaling)不止堆参数这一条途径。

如果梳理下这些年模型训练的发展路线:

- 2020 年 Kaplan 等人的研究建议参数增长要远快于数据,GPT-3、Gopher 都是这个思路的产物。

- 2022 年 DeepMind 的 Chinchilla 论文则认为参数和数据应该同步增长,参数大的模型反而是最浪费算力的。

- 再后来,大家发现模型上线后推理成本远超训练成本,最优解又变成了用更小的模型训更久,比如 Llama-2-7B 每个参数喂了约 290 个 token,Gemma-2-9B 更是喂了 889 个。

模型能力由很多因素决定:底座大小、预训练数据量、每次前向传播的计算量、后训练。

对于现阶段,模型后训练还有很大潜力可以挖掘。

发布于 美国