论文

LOTAPO:多轮搜索推理中自生成过程奖励的留一轮归因

LOTAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

多轮搜索推理的强化学习通常依赖终端结果奖励——无法区分有用、冗余与有害的中间交互。我们提出LOTAPO:一种基于后向留一轮归因的自生成过程监督方法。对每个搜索轮,LOTAPO把该轮及其检索观察替换为固定的[DELETE]占位符,度量当前策略对金标答案的平均对数似然变化。这个“答案似然增益”在保留全部下游交互的同时估计该轮贡献——让早期证据在完整推理上下文中被评估。LOTAPO进一步施加符号一致性门控:仅保留方向与原始归因分一致的归一化过程优势。该方法不需要额外奖励模型、教师、验证器或LLM即裁判。跨七个本地检索的知识密集型问答数据集:LOTAPO取得平均精确匹配0.326,超最强步级奖励基线IGPO 0.053。消融显示后向归因与符号一致性门控的互补收益——证明策略自派的回溯归因可为多轮搜索智能体提供有效过程监督。

LOTAPO:多轮搜索推理中自生成过程奖励的留一轮归因:论文配图
图 1:LOTAPO 概述。对于每个完整的搜索轨迹,LOTAPO 依次用 [DELETE] 替换每个符合条件的搜索回合及其检索观察,并使用替换前后当前策略的黄金答案的平均对数似然差异来估计回合级别归因。生成的归因分数经过稳健缩放、tanh 有界变换、组标准化和符号一致性门控。然后将它们分配给相应搜索轮次的策略生成的标记,并与轨迹级结果优势联合使用以进行策略优化。