论文
通过事实效用估计对搜索代理进行密集流程监督
Dense Process Supervision for Search Agents via Fact Utility Estimation
摘要
搜索代理的强化学习(RL)通常依赖于结果奖励。然而,由于中间步骤的价值不明确,它常常无法实现有效的信用分配。很难将他们的贡献与最终结果分开。在本文中,我们提出了一种基于事实效用估计的密集过程监督方法,该方法将推理过程建模为离散证据事实的积累。我们首先从原始观察中提取结构化事实,并将它们组织成明确的事实存储。为了支持信用分配,我们对语义等效的事实进行聚类,并使用成组采样轨迹的贝叶斯估计来推断每个事实聚类的后验效用。最后,我们将估计的事实效用转换为密集的步骤级奖励来指导 RL 训练。对七个单跳和多跳 QA 基准的实验表明,我们的方法始终优于现有基线。消融研究验证了与仅结果奖励训练相比,多跳 QA 的明显相对改进。