近日,来自上海人工智能实验室的徐兴成博士,通过论文《策略悬崖:大模型中从奖励到策略映射的理论分析》,揭示了强化学习深处一个名为 “策略悬崖” 的深刻挑战。 http://t.cn/A6sXl4aw

机器之心Pro
25-08-13 14:30 微博认证:机器之心官方微博
近日,来自上海人工智能实验室的徐兴成博士,通过论文《策略悬崖:大模型中从奖励到策略映射的理论分析》,揭示了强化学习深处一个名为 “策略悬崖” 的深刻挑战。 http://t.cn/A6sXl4aw