论文

OPDSearch+:面向搜索增强推理的在线策略蒸馏与RL精炼

OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning

摘要

搜索增强推理对小语言模型来说仍然困难。从训练好的教师模型进行在线策略蒸馏(OPD)是一个有前景的方向,但存在两个问题:(1)高质量的多轮搜索轨迹依赖动态检索器响应,使SFT数据的规模化收集成本高昂;(2)针对任务训练的教师带来高昂训练成本,而直接用现成教师做OPD(不做任务特定微调)会把学生限制在教师的性能上限,并遭受严重的训练不稳定。我们提出OPDSearch+,首个无需教师微调即可用于搜索增强推理的蒸馏范式。我们考察冻结的现成指令模型作为教师在在线策略蒸馏中的作用,并揭示一个关键洞察:教师重塑学生的策略分布,使后续RL收敛到仅靠RL无法达到的更优解。第一阶段,学生与真实搜索引擎交互,通过逐位置前向KL目标进行蒸馏,在不进行任何任务特定教师训练的情况下迁移推理分解与证据整合技能。第二阶段,RL从更丰富的行为基础出发精炼蒸馏后的学生,达到从零开始仅靠RL无法企及的性能。在七个QA基准上,OPDSearch+的3B模型持续超越所有此前的3B RL基线,在HotpotQA上提升13.1%,在2WikiMultihopQA上提升8.5%。

OPDSearch+:面向搜索增强推理的在线策略蒸馏与RL精炼:论文配图
图1:左:先前的OPD需要昂贵的任务特定教师训练;纯RL的多跳增益有限。右:OPDSearch+通过使用冻结的现成教师消除教师训练。教师通过在策略蒸馏重塑学生的分布,使后续RL能够逃离局部最优,并在单跳、多跳和域内取得强劲表现。