论文
Prune-OPD:高效可靠的 同策略 蒸馏 用于长视野推理
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
摘要
同策略 蒸馏 (OPD) 利用密集的教师奖励来增强推理模型。然而,将 OPD 扩展到长期任务暴露了一个关键缺陷:由于学生生成的前缀不可避免地偏离教师的思维过程,教师的密集奖励失去了局部可利用性。继续在这些“漂移”轨迹上生成和评估词元不仅会降低奖励质量,还会产生大量计算浪费。为了解决这个问题,我们引入了 \textbf{Prune-OPD},一个动态调整训练预算与监督质量的框架。通过持续监控学生和教师预测之间的本地兼容性(例如,通过 top-$k$ 重叠),Prune-OPD 实时检测前缀漂移事件。一旦检测到严重的漂移,它就会单调地降低后续不可靠奖励的权重并触发动态采样轨迹截断。这使得训练过程能够停止无用的生成,并将计算严格重新分配给可靠的教师监督。在不同的师生组合中,Prune-OPD 始终使计算与监督可靠性保持一致。当前缀漂移使密集的教师奖励变得不可靠时,它会将训练时间减少 37.6\%--68.0\%,同时保持并经常提高在具有挑战性的基准(AMC、AIME、HMMT)上的性能。当学生与教师的兼容性保持较高水平时,它会通过扩展训练窗口自动保留长上下文监督。这些结果表明,Prune-OPD 不是通过盲目缩短采样轨迹时间来改善 OPD,而是通过将计算重新分配给本地可利用的教师奖励来改善 OPD。