论文

SD-Search:面向搜索增强推理的在策事后自蒸馏

SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning

模型训练强化学习奖励建模与过程监督RLVRAgentic RL

摘要

搜索增强推理智能体将内部推理与外部检索器调用交织进行,其性能取决于所发出的每个查询的质量。然而,在结果奖励强化学习下,一次rollout中的每个搜索决策共享同一轨迹级奖励,单个查询缺乏步骤级的贡献归因。近期的过程监督方法通过从策略外部获取步骤级信号来弥补这一缺口,要么依赖大得多的教师模型,要么依赖更强外部系统生成的子问题标注。与之不同,我们提出SD-Search,通过在策事后自蒸馏从策略自身获得步骤级监督,既不需要外部教师也不需要额外标注。在SD-Search中,单一模型扮演两种仅以条件不同而区分的角色:学生只看到推理时可用的上下文,教师则额外以一个紧凑的事后块为条件,该块总结了从同一问题采样的一组rollout的搜索查询与最终结果。由于教师知道每个rollout如何展开以及哪些成功,其查询分布隐式标记了哪些决策值得做出;学生在搜索查询位置通过最小化与教师的token级Jensen-Shannon散度来训练以复现这一行为。这在GRPO粗糙的轨迹奖励之上叠加了一个稠密的步骤级信号。关键在于,该信号由策略自身在标准RL训练循环内产生,无需外部模型推理、辅助标注流水线或额外训练阶段。

SD-Search:面向搜索增强推理的在策事后自蒸馏:论文配图
图 1:监督搜索决策的三种范式。 (a) 结果奖励(例如 AutoRefine):单一轨迹级奖励,无法区分好的和坏的单个查询。 (b) 过程监督(例如 Thinker、StepSearch):从外部源导入的步骤级信号(72B 教师或 GPT-4o 生成的子问题注释)。 (c) SD-Search(我们的):政策事后自我蒸馏直接从政策本身产生阶梯级监督,无需外部资源。