尤洋1627
26-08-30 22:23 微博认证:北京潞晨科技有限公司 董事长

目前AI大模型后训练有两种流行方式:SFT和OPD。

SFT:学习老师的做题步骤和答案 (抄作业)。

OPD:学生先做题,然后老师给学生纠错。

对大多数人类学习而言,OPD比SFT效果好。因为人类在SFT(抄作业)时容易分心,可能没有真正理解,实质没有学到。

但是对AI大模型其实有点不一定,因为SFT一定会通过梯度更新参数。也就是说,只要老师模型水平高、数据质量好,用SFT大概率能让学生模型学到东西。

大模型的参数更新类似于人类的“领悟”,甚至可能是“醍醐灌顶”。

所以,还不能下结论说OPD会比SFT更好。

当然,不论对人类还是AI大模型而言,OPD听起来都更加珍贵:学生先暴露自己的问题,再得到老师一对一的针对性指导。直觉上OPD更好。

但有趣的是,SFT对AI也没有“抄作业”这个比喻听起来那么笨。即使面对同一份老师答案,不同学生模型因为参数不同,算出来的梯度也不同:已经会的地方改得少,不会的地方改得多。因此,SFT本身也包含一定程度的“因材施教”。

OPD真正更有针对性的地方,是连学生遇到什么问题,都是由学生自己先做出来的。

所以两者到底谁更好,其实并不确定。

更关键的问题可能是:对于最顶尖的神童人类和“神童模型”,智能的上限是不是最终要靠自学达到的?

发布于 新加坡