论文
LOTAPO:多轮搜索推理中自生成过程奖励的留一轮归因
LOTAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning
摘要
多轮搜索推理的强化学习通常依赖终端结果奖励——无法区分有用、冗余与有害的中间交互。我们提出LOTAPO:一种基于后向留一轮归因的自生成过程监督方法。对每个搜索轮,LOTAPO把该轮及其检索观察替换为固定的[DELETE]占位符,度量当前策略对金标答案的平均对数似然变化。这个“答案似然增益”在保留全部下游交互的同时估计该轮贡献——让早期证据在完整推理上下文中被评估。LOTAPO进一步施加符号一致性门控:仅保留方向与原始归因分一致的归一化过程优势。该方法不需要额外奖励模型、教师、验证器或LLM即裁判。跨七个本地检索的知识密集型问答数据集:LOTAPO取得平均精确匹配0.326,超最强步级奖励基线IGPO 0.053。消融显示后向归因与符号一致性门控的互补收益——证明策略自派的回溯归因可为多轮搜索智能体提供有效过程监督。
