论文

ABSeeker:通过答案回溯信用分配训练长程搜索Agent

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

模型训练强化学习奖励建模与过程监督RLVRAgentic RL

摘要

长时跨度搜索代理必须执行多个连续的动作(步骤)来搜索、检索、验证和整合证据以达到最终答案。然而,现有的方法在训练这些代理时通常对轨迹中的所有步骤进行统一处理,在监督微调(SFT)和强化学习(RL)中都未能区分有用的动作与无效或冗余的动作。在这篇论文中,我们提出了一种名为Answer-Backtracked Credit Assignment(ABC)的细粒度信用分配框架,用于训练长时跨度搜索代理。通过将稀疏轨迹级别的结果转换为密集步骤级别的监督,奖励有用的行动(即使在失败的轨迹中),同时抑制无效或冗余的动作。具体来说,给定一个潜在的查询及其对应的地面真相答案,ABC首先执行Answer-Backtracked Clue Recovery,从答案回溯到恢复解决问题所需的中间线索。然后应用Clue-Anchored Step Scoring来评估每个搜索步骤与这些线索相对应,将稀疏二元结果监督转换为密集步骤级别的奖励。基于这些奖励,我们开发了ABC-SFT,对每一步进行权重调整,并开发了ABC-GRPO,在GRPO中使用步骤级别的评分作为奖励。基于这个框架,我们使用Qwen3.5-4B训练ABSeeker,仅使用8. 5k个示例。ABSeeker在BrowseComp和BrowseComp-ZH上分别达到37. 3%和39. 1%的性能。借助上下文管理,分数进一步提高到55. 3%和52. 9%,显著超越了同规模(4B)的代理,并甚至与更大规模(约30B)的代理相匹配。这些结果展示了答案-回溯步骤级别的信用分配在训练长时跨度搜索代理中的有效性。

ABSeeker:通过答案回溯信用分配训练长程搜索Agent:论文配图
图 1:ABSeeker 在 4B 模型中实现了最佳性能,并且与几个较大的搜索代理保持了竞争力。条纹区域表示启用上下文管理的结果。