论文
BiCAA:搜索增强代理的双向信用分配
BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent
摘要
多步搜索是搜索代理的一项基本功能,使它们能够迭代获取、细化和集成外部证据以进行复杂的推理 QA。然而,普通的 GRPO 仅根据模型的最终输出分配奖励,产生仅结果监督,没有中间推理步骤的监督信号。这种稀疏监督很容易导致多步搜索任务上的训练不稳定和冗余搜索行为。为了减轻这种限制,我们采用过程奖励来提供逐步的监督信号。对于这个过程奖励,我们提出了两个补充标准来判断每个搜索步骤:该步骤是否产生新的证据以促进问题解决,以及它是否在整体推理轨迹中形成有效的、关键的中间决策。基于这一见解,我们提出了 BiCAA:一种双向信用分配框架,为搜索增强代理提供密集、独特的流程奖励。 BiCAA 通过融合两个互补信号来构建双向过程奖励:前向解决能力增益和事后成功关键性。前者量化了答案合理性的逐步改进,而后者则通过事后基于结果的关键性评分来评估每个步骤对于最终成功的必要性。我们调制并聚合这两个信号,然后将它们与结果奖励融合。搜索增强 QA 基准测试表明,BiCAA 稳定了策略优化,减少了冗余搜索行为,并实现了有竞争力的性能。