新浪热点
25-01-28 16:44 微博认证:新浪热点官方微博

#小模型更适合知识蒸馏吗#

先来一段来自 Deepseek R1的新春祝福,足够震惊了:

“守岁的烛火摇红时,请收下这封穿越二十四节气的信笺:愿锦鲤游弋于岁月的清波,喜鹊筑巢在光阴的枝桠。从此朝暮有清欢,万事胜意;福暖四季,顺遂安康。”

不过这还是一个技术贴哈哈哈。#数据蒸馏是deepseek核心竞争力之一#

单纯从科研角度,R1的工作简单但非常直接有效,这是大多数研究人员最喜欢的工作-简洁但是实用。我个人觉得 Deepseek R1 版本做对了三件事:

1.验证纯强化学习可以涌现思维链: ChatGPT 的 o1 模型里,思维链是最先进的部分。官方报告表示在足够的强化学习以及监督微调(SFT)后,思维链可以自动涌现。然而话是这么说,目前还没有公司复现。Deepseek 的 R1 不仅实现,改进(纯强化学习,放弃了MCTS等传统搜索优化,这个实现非常非常难),甚至还开源了。

-关于这点碎碎念几句,在增强学习训练过程中,模型为提升任务成功率,自发产生平均长度增长432%的思维链;在训练中期,模型出现自发性错误检测行为(如输出"等等!这里有问题..."并重启推理流程),展现元认知能力雏形。这也说明了,纯环境奖励足以激发复杂认知能力,当奖励函数足够鲁棒时,智能体或能自主进化超越预设能力边界。

几乎等于以一己之力公开了 openAI 最大的商业秘密之一。

2.模型规模效应悖论:在大模型早期,很多公司认为“大就是真理”,各种追求模型参数规模。在 R1 的实验里,就增强学习训练来说,大模型(32B)的训练效果有限,模型参数是存在上限的,小模型更适合知识蒸馏,大模型需自主推理演化,当然这个可能也和算力有关。

3.(也许和技术关系不大)证架构和训练方法依然有很大提升空间(There are more room on-the-top):这一轮 AI 爆发的核心观点是,算力多少就意味着智能高低,所以英伟达等等公司才掀起这一阵的美股泡沫。如果架构依然可以继续创新,那么我们是否还那么迫切需要追求算力?英伟达需要那么高估值吗?(文源 @甜草莓的科学小屋)