大龙的AGI之旅
26-06-05 19:49

有个研究专门搞了个环境来复现强化学习中的reward hacking现象。思路挺直接,通过注入已知偏见到LLM评委里,让模型学会钻空子。虽然现实中的hacking可能更隐蔽,但有个可控的测试床总比没有强。

http://t.cn/AXXKZGRH ​

发布于 江苏