论文
STAMP:面向深度搜索智能体的出处引导信用分配
STAMP: Provenance-Guided Credit Assignment for Deep Search Agents
摘要
面向深度搜索智能体的强化学习大多聚焦轨迹级打分——结果正确性、引用感知奖励与证据覆盖。但暴露支撑文档的动作得不到定向信用——我们称之为奖励—信用错配。我们提出STAMP:由参照型验证器判断每篇被引用文档是否支撑训练时证据图中的实体或关系,首次曝光归因把每条受支撑引用回溯到首次暴露它的动作。该步级信用经保号优势调制注入:在不改变轨迹级奖励或组内轨迹相对排序的前提下重新分配各步优势。在BrowseComp、BrowseComp-ZH与xbench-DS上:在匹配的SFT初始化、训练数据与搜索工具下,STAMP较GRPO基线提升+2.0/+5.5/+3.0分,并与仅有结果与引用量规两种基座奖励均可组合。组件消融确认出处信用信号与保号优势调制各自贡献增益。
