论文
超越轨迹奖励:基于图建模的 Agentic Search 步级贡献归因
Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling
摘要
在 Agentic Search 中,轨迹级结果奖励无法量化单个步骤的行为贡献,而现有的步级奖励方法通常依赖代价高昂的树采样。我们将世界知识视为一个潜在世界图(latent world graph),把每个 IS 任务视为在潜在任务图中的搜索,其中有效的步骤应当使图向答案节点推进。基于这一先验,我们提出图距离贡献奖励(Graph-Distance Contribution Reward, GDCR),这是一种步级过程奖励,依据新检索到与新引用的实体在训练时构建的实体—关系(ER)图中到答案节点的距离进行打分。我们进一步提出步骤优势策略优化(Step Advantage Policy Optimization, SAPO),它将 GDCR 转化为步级优势,并将其与轨迹级结果优势相结合。在四个具有挑战性的基准上的实验验证了我们方法的有效性。
