强烈建议大家看一下 Jev 创始人 Diogo Almeida 的这个演讲,关于 Jev 的一切,他在这个视频中早就预言。
Jev 一开始就是盯着自动化去的, Diogo Almeida 认为现在的 LLM 陷入了一个史诗级大弯路,就是 RLHF。
RLHF 在人机交互也就是取悦人类方面,很出色,但在自动化方面很糟糕。它不能实现完全的自动化,人类必须在环。
不止 ChatGPT ,Claude Code 的原罪也在于 RLHF。所以他认为 ChatGPT 和 Claude Code 本质上属于一个范式,Claude Code 并不是下一个时代,真正的自动化才是下一个时代。
简单来说,RLHF 就是收集人类便好,并根据人类便好优化。它的优化目标也不是自动化。
他也否定了 RLVR 是答案:RLHF 优化人类偏好,RLVR 优化纯正确性,而他们在做的第三条路优化的是校准过的决策能力。
Diogo Almeida 认为,数据比算力重要,做对的任务比数据重要得多。预训练模型本身已经足够聪明,问题只在于我们用偏好优化把它挖歪了。
PS:视频翻译是用@宝玉xp 的 BaoCut 做的,属于是我的梦中情译软件了,太好用了。 http://t.cn/AXOT7NVL
发布于 北京
