论文

超越轨迹奖励:基于图建模的 Agentic Search 步级贡献归因

Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

在 Agentic Search 中,轨迹级结果奖励无法量化单个步骤的行为贡献,而现有的步级奖励方法通常依赖代价高昂的树采样。我们将世界知识视为一个潜在世界图(latent world graph),把每个 IS 任务视为在潜在任务图中的搜索,其中有效的步骤应当使图向答案节点推进。基于这一先验,我们提出图距离贡献奖励(Graph-Distance Contribution Reward, GDCR),这是一种步级过程奖励,依据新检索到与新引用的实体在训练时构建的实体—关系(ER)图中到答案节点的距离进行打分。我们进一步提出步骤优势策略优化(Step Advantage Policy Optimization, SAPO),它将 GDCR 转化为步级优势,并将其与轨迹级结果优势相结合。在四个具有挑战性的基准上的实验验证了我们方法的有效性。

超越轨迹奖励:基于图建模的 Agentic Search 步级信用分配:论文配图
图 1:(a) 我们提出的 SAPO 和其他 RL 方法之间的比较,其中用不同颜色表示的步骤具有不同的优势值。 GRPO 忽略了每个步骤贡献的差异,而基于树采样的步骤级策略优化在估计步骤贡献时会产生大量的计算开销。 (b) 我们的方法基于先验知识,即检索到的实体将搜索代理推进到潜在任务图中的答案节点越多,其对获得正确解决方案的贡献就越大。