论文

IG-Search:面向搜索增强推理的步级信息增益奖励

IG-Search: Step-Level Information Gain Rewards for Search-Augmented Reasoning

模型训练强化学习奖励建模与过程监督RLVRAgentic RL

摘要

强化学习已成为训练大语言模型执行搜索增强推理的有效范式。然而,现有方法依赖轨迹级奖励,无法在rollout组内区分精确的搜索查询与模糊或冗余的搜索查询,且当所有采样轨迹都失败时,梯度信号会衰减到近乎为零。本文提出IG-Search,一个引入基于信息增益(Information Gain, IG)的步级奖励的强化学习框架。对每个搜索步骤,IG衡量相对于随机文档构成的反事实基线,检索到的文档在多大程度上提升了模型对金标准答案的置信度,从而反映底层搜索查询的有效性。该信号通过GRPO中的逐token优势调制反馈到对应的搜索查询token上,实现rollout内部细粒度的步级贡献归因。与需要外部标注中间监督或跨轨迹共享环境状态的既有步级方法不同,IG-Search从策略自身的生成概率导出信号,除标准问答对外无需任何中间标注。在七个单跳与多跳问答基准上的实验表明,IG-Search配合Qwen2.5-3B取得平均0.430的EM,在各基准上平均比最强的轨迹级基线(MR-Search)高1.6分、比步级方法GiGPO高0.9分,在多跳推理任务上提升尤为显著。尽管引入了稠密的步级信号,IG-Search相对轨迹级基线仅增加约6.4%的单步训练耗时,推理延迟保持不变,且即使所有采样轨迹都答错时仍能提供有意义的梯度信号。

IG-Search:面向搜索增强推理的步级信息增益奖励:论文配图
图 1:轨迹级奖励掩盖了步骤级查询质量。尽管左侧轨迹执行精确搜索,右侧轨迹检索不相关的内容,但两者都会因产生相同的最终答案而获得相同的奖励。