爱可可-爱生活
26-07-21 05:48 微博认证:AI博主 2025微博新锐新知博主

[CL]《Process Reward Informed Tree Rollout for Effective Multi-Turn RL》X Li, S Li, Y Zhang, C Yu…[UC San Diego & Amazon] (2026)

在多轮智能体(Agent)强化学习领域,如何高效分配采样算力是一个悬而未决的难题。过去的方法(如 GRPO/RLOO)受困于对完整轨迹的均匀独立采样,本质原因是这种“平权”策略在死胡同路径上浪费了大量预算,却导致高价值的中间状态缺乏深度探索。

本文的核心洞见是:把多轮交互轨迹组重新看作一棵可动态生长的决策树。由此,PATR 这一关键操作使问题得以解开:利用过程评分器(Process Scorer)定期评估分支质量,对高分路径进行“扩增”探索,对平庸路径维持“生存”,并对退化路径及时“剪枝”,从而在相同预算下榨取更高密度的信息。

这项工作真正留下的遗产是证明了“过程引导的树状采样”能显著提升长程任务(如 SWE-Bench)的训练效率。它为后来者打开的新门是将过程奖励模型(PRM)从单纯的验证工具转化为动态资源分配引擎,但尚未跨过的门槛是过程评分器本身的偏差可能误导探索方向,且在极度开放的任务中定义“进度”依然存在挑战。

arxiv.org/abs/2607.15610 #机器学习# #人工智能# #论文# #AI创造营#

发布于 北京