论文

面向 Agentic 强化学习关键决策的信用分配

Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning

模型训练奖励建模与过程监督

摘要

组相对策略优化(GRPO)已成为训练大语言模型 Agent 的一种有前景的方法。但它将轨迹级优势统一分配给所有策略词元,无法区分关键决策与较不相关的决策,因而掩盖了哪些中间决策促成成功。我们提出 ProVer,在 Agentic 强化学习中针对可能具有关键作用的决策开展细粒度信用分配。给定一组 rollout,Agentic 裁判比较成功与失败轨迹,提出可能导致结果分化的片段。ProVer 并不直接相信裁判,而是在该片段之前和之后分别采样当前策略的后续执行,以最终成功率之差估计片段优势,从而验证所提片段。随后,将正的估计值加入该片段内策略词元的 GRPO 优势。模型判断只负责选择验证位置,因此 ProVer 将局部信用建立在观测结果上,无需穷举评价每个中间状态。在 ALFWorld、WebShop 和 SearchQA 上,ProVer 在两种模型规模下都取得所比较方法中最好的平均表现;Qwen3.5-2B 和 Qwen3.5-4B 相对 GRPO 的提升分别为 9.91% 和 7.12%。进一步分析显示,有信息依据的片段选择只需少量额外生成开销即可改善策略训练,即使不采用前沿规模的裁判模型也有效。这表明选择性针对关键决策开展细粒度信用分配,在 Agentic 强化学习中兼具有效性与效率。