jev 的确可能有不同的训练概念。
RLHF 优化“讨人喜欢”,
RLVR 优化“客观正确”(主要是DeepSeek推动),
RLCD 优化“正确 + 概率诚实”。
目前 TypeSafe 只公布了名字和目标,没有公开论文、数据或具体算法细节。
但是你想想 RLCD 的正确和 RLVR 的正确有本质区别吗?
发布于 云南
jev 的确可能有不同的训练概念。
RLHF 优化“讨人喜欢”,
RLVR 优化“客观正确”(主要是DeepSeek推动),
RLCD 优化“正确 + 概率诚实”。
目前 TypeSafe 只公布了名字和目标,没有公开论文、数据或具体算法细节。
但是你想想 RLCD 的正确和 RLVR 的正确有本质区别吗?