目前AI大模型后训练有两种流行方式:SFT和OPD。
SFT:学习老师的做题步骤和答案 (抄作业)。
OPD:学生先做题,然后老师给学生纠错。
对大多数人类学习而言,OPD比SFT效果好。因为人类在SFT(抄作业)时容易分心,可能没有真正理解,实质没有学到。
但是对AI大模型其实有点不一定,因为SFT一定会通过梯度更新参数。也就是说,只要老师模型水平高、数据质量好,用SFT大概率能让学生模型学到东西。
大模型的参数更新类似于人类的“领悟”,甚至可能是“醍醐灌顶”。
所以,还不能下结论说OPD会比SFT更好。
当然,不论对人类还是AI大模型而言,OPD听起来都更加珍贵:学生先暴露自己的问题,再得到老师一对一的针对性指导。直觉上OPD更好。
但有趣的是,SFT对AI也没有“抄作业”这个比喻听起来那么笨。即使面对同一份老师答案,不同学生模型因为参数不同,算出来的梯度也不同:已经会的地方改得少,不会的地方改得多。因此,SFT本身也包含一定程度的“因材施教”。
OPD真正更有针对性的地方,是连学生遇到什么问题,都是由学生自己先做出来的。
所以两者到底谁更好,其实并不确定。
更关键的问题可能是:对于最顶尖的神童人类和“神童模型”,智能的上限是不是最终要靠自学达到的?
发布于 新加坡
