爱可可-爱生活
24-01-19 07:59 微博认证:AI博主 2025微博新锐新知博主

【LLM的偏好微调和对齐】
- 评估了三种不需要强化学习的大语言模型优化方法:直接优化偏好(DPO)、身份偏好优化(IPO)和卡内曼-塔弗斯基优化(KTO)。
- DPO通过将偏好微调问题转换为一个简单的损失函数来实现,而IPO则在DPO的基础上添加了正则化项以避免过拟合。KTO则完全基于“好”或“坏”的单个示例来定义损失函数。
- 在两个高质量的7B参数语言模型上对这三种方法进行了超参数扫描实验,发现DPO表现最好,但关键超参数beta需要调优。
- 在Zephyr模型上,当beta取0.01时所有三种方法效果最好。DPO可以达到最高的MT Bench分数,但KTO的表现也很接近。IPO的效果则不如基础模型。
- 在OpenHermes模型上,每个方法的最佳beta值差异很大。DPO仍优于其他两种方法,但基础模型已经很强,调整后提升不大。
- 文章开源了所有的代码和配置文件,重现了这些实验结果。DPO目前看来是最强大且稳定的语言模型优化算法。
- 未来将继续在TRL中实现新的优化算法并评估其性能。希望能开发出比DPO更好的方法,或能从仅带“好”“坏”标签的数据中进行调整的KTO。
《Preference Tuning LLMs with Direct Preference Optimization Methods》 http://t.cn/A6jqYa0o #机器学习# #人工智能#

发布于 北京