李楠或kkk
26-09-20 08:10 微博认证:Angry Miao创始人 财经观察官

jev 的确可能有不同的训练概念。

RLHF 优化“讨人喜欢”,
RLVR 优化“客观正确”(主要是DeepSeek推动),
RLCD 优化“正确 + 概率诚实”。

目前 TypeSafe 只公布了名字和目标,没有公开论文、数据或具体算法细节。

但是你想想 RLCD 的正确和 RLVR 的正确有本质区别吗? ​

发布于 云南