论文

STAMP:面向深度搜索智能体的出处引导信用分配

STAMP: Provenance-Guided Credit Assignment for Deep Search Agents

模型训练强化学习RLVRAgentic RL

摘要

面向深度搜索智能体的强化学习大多聚焦轨迹级打分——结果正确性、引用感知奖励与证据覆盖。但暴露支撑文档的动作得不到定向信用——我们称之为奖励—信用错配。我们提出STAMP:由参照型验证器判断每篇被引用文档是否支撑训练时证据图中的实体或关系,首次曝光归因把每条受支撑引用回溯到首次暴露它的动作。该步级信用经保号优势调制注入:在不改变轨迹级奖励或组内轨迹相对排序的前提下重新分配各步优势。在BrowseComp、BrowseComp-ZH与xbench-DS上:在匹配的SFT初始化、训练数据与搜索工具下,STAMP较GRPO基线提升+2.0/+5.5/+3.0分,并与仅有结果与引用量规两种基座奖励均可组合。组件消融确认出处信用信号与保号优势调制各自贡献增益。

STAMP:面向深度搜索智能体的出处引导信用分配:论文配图
图 2:STAMP 概述。引文来源将经过验证的证据追溯到其最早的曝光步骤,将文档级支持转换为步骤级信用。然后,符号保留优势调制会放大正轨迹中的记分步数 (Atraj>0A_{\mathrm{traj}}>0),并保护它们免受负轨迹中的统一惩罚 (Atraj<0A_{\mathrm{traj}}<0),而未记分的步数保留原始轨迹优势。