复旦博士张迪的文章:什么是 RLCD?Jev 背后的秘密
文章介绍 Jev 背后的(可能的)数学原理:从偏好建模到概率校准
地址:di-zhang-llm.github.io/blog/what-is-rlcd-the-secret-behind-jev/
作者认为,Jev 是把传统的 Reward Model(奖励模型)直接做成了产品:输入状态和候选动作,直接输出经过校准的决策概率。RLCD 则是它背后的训练思想。
RLCD≈多选偏好建模+概率校准
发布于 山东
