论文
SD-Search:面向搜索增强推理的在策事后自蒸馏
SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning
摘要
搜索增强推理智能体将内部推理与外部检索器调用交织进行,其性能取决于所发出的每个查询的质量。然而,在结果奖励强化学习下,一次rollout中的每个搜索决策共享同一轨迹级奖励,单个查询缺乏步骤级的贡献归因。近期的过程监督方法通过从策略外部获取步骤级信号来弥补这一缺口,要么依赖大得多的教师模型,要么依赖更强外部系统生成的子问题标注。与之不同,我们提出SD-Search,通过在策事后自蒸馏从策略自身获得步骤级监督,既不需要外部教师也不需要额外标注。在SD-Search中,单一模型扮演两种仅以条件不同而区分的角色:学生只看到推理时可用的上下文,教师则额外以一个紧凑的事后块为条件,该块总结了从同一问题采样的一组rollout的搜索查询与最终结果。由于教师知道每个rollout如何展开以及哪些成功,其查询分布隐式标记了哪些决策值得做出;学生在搜索查询位置通过最小化与教师的token级Jensen-Shannon散度来训练以复现这一行为。这在GRPO粗糙的轨迹奖励之上叠加了一个稠密的步骤级信号。关键在于,该信号由策略自身在标准RL训练循环内产生,无需外部模型推理、辅助标注流水线或额外训练阶段。
