刚刚,智谱创始人唐杰老师,在 X 上发了一篇超棒的帖子,专门说了下他对 Scaling Law 的理解(图1)。
正好今天 AA 的成绩也出来了,GLM-5.3 拿到了 60 分,上一代 GLM-5.2 是 53 分,基座是完全相同的,总参数 753B,激活 40B,而且大家 Coding 体感也都很棒,都觉得是国产 SOTA 了。 (图2)
但也有很多人也在说为啥智谱这次不训个新的基座模型。
唐老师这篇帖子,刚好讲的非常清楚,也有非常多的干货。
他说,Scaling,从来不只有参数量这一个点。
我们以前一聊大模型,最先问的总是参数量,但是参数量单独拿出来,其实说明不了多少东西。
现在它至少还得跟另外三个问题放在一起看:
模型有多少数据。
算力花在了哪。
谁在什么条件下运行它。
这背后,其实是 Scaling Law 过去几年一直在发生的变化。
2020 年,Kaplan 等人算出一个比例,认为参数增长应该比数据增长快得多,大概是 2.7 比 1。然后整个行业也都这么走了,很多模型越做越大,万亿参数也一度被当成了模型进步的必经之路。
到了 2022 年,Hoffmann 等人拿四百多个模型重新做了一遍实验,结果发现,算力最优的分配更接近每个参数 20 个 Token。算力继续增加时,参数和数据应该以差不多的速度一起增长。
这就是 Chinchilla Scaling Law。
其实现在回头看,之前那一轮最大的模型,反而也是算力分配最失衡的一批。参数堆得太快,数据没有跟上,实际上效果没有那么好。
但版本还在变化,
因为 Chinchilla 考虑的是一个模型训练一次,然后拿去评测。
但是今天的模型上线以后,每天可能被调用几十亿次,上线后的推理成本可能远远大于那一次训练。
所以如果我们把这笔账也算进去,最优解又会往更小、训练更久的模型移动。
到了 MoE 时代,那个简单的 20 比 1 也不够用了。
唐老师在帖子里区分了两个很重要的东西。
总参数量,大概决定模型能装下多少知识、事实和长尾信息。
激活参数和每次前向计算的有效深度,大概决定模型的长程推理能力。
需要记忆的任务,更吃参数量。
需要推理的任务,更吃数据。
后续研究甚至发现,在每个参数对应 Token 数量固定时,继续增加总参数可能会让推理变差,激活更多专家反而会稳定地提升推理能力。
所以,大模型到底有多聪明,早就没法被一个总参数量概括了。
GLM-5.3 这次,唐老师说,它更像一次控制变量实验。
大模型 Scaling 依然在继续。
只是它已经从一个越来越大的数字。
变成了寻找最优解的游戏。
#AI##科技先锋官##GLM-5.3##How I AI#
