论文

基于过程奖励的树状轨迹采样,提高多轮强化学习效率

Process Reward Informed Tree Rollout for Effective Multi-Turn RL

模型训练强化学习

摘要

强化学习(RL)已成为训练 LLM 智能体的关键方法,但 GRPO/RLOO 等流行方法依赖于多个独立采样的完整轨迹来进行优势估计。在长期代理任务中,这种统一的轨迹采样策略可能会在无信息的死胡同尝试上浪费预算,而有希望的中间状态没有得到足够的探索。代理轨迹的多轮结构,具有交错的动作和观察,自然支持将轨迹组组织为树,其中每个轮作为探索的决策点。这种观点将有效探索重新定义为决定分支的问题。我们提出了 Process-Scorer Guided Adaptive Tree Rollout (PATR),这是一种用于多轮智能体强化学习的质量感知轨迹采样框架。 PATR 使用适合任务的过程反馈来对部分轨迹进行评分,有选择地从有希望的状态分支,重用共享前缀,并保守地停止退化路径以减少浪费的采样。由此产生的轨迹采样组仍然与标准策略优化兼容,同时在相同的训练预算下提供更有效的探索。我们在 FrozenLake 和具有挑战性的 SWE-Bench 上评估 PATR,这在很大程度上是先前的树轨迹采样代理 RL 方法尚未探索的。实验表明,PATR 在 SWE-Bench 上将性能提高了 5.0 点,在 FrozenLake 上提高了 9.3 点,这凸显了流程引导树部署是可扩展多轮 RL 的有效策略。