论文
更好的监管即将到来:邻里政策自我蒸馏
Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation
摘要
按on-policy自蒸馏 (OPSD) 使用特权教师来训练数学推理模型,该教师查看参考解决方案并监督学生采样的前缀。标准 OPSD 在每种状态下使用一个固定参数设置,但附近的设置可能会提供额外的监控。我们发现局部参数扰动揭示了相同参考上下文下互补的参考对齐校正。不同的专家在不同的参考位置提供这些修正。他们的人才库涵盖的此类职位比泰然自若的特权教师还要多。我们引入邻里 OPSD (N-OPSD),将这些纠正转化为学生访问州的监督。离线时,贪婪选择通过奖励过滤后的参考词元收益,建立了一个紧凑的冻结专家池,该收益超出池中每个位置的当前最佳值。最高峰的专家并不需要提供最好的训练目标。因此,在线路由将锚点方向与其支持级别分开。 MaxPeak 选择锚标记,而分位数选择则在顶部标记与之匹配的专家中进行选择。学生通过从 OPSD 继承的裁剪前向 KL 目标,从所选专家的完整下一个词元分布中学习。我们对 AIME 2024、AIME 2025 和 HMMT 2025 年 2 月进行评估。在每种方法的三次独立运行中,Neighborhood OPSD 在 Qwen3-1.7B、4B 和 8B 上分别比 OPSD 提高了三个基准 Average@12 2.75、1.67 和 1.94 点。学生前缀延续支持在用于选择的参考轨迹之外使用池。匹配的消融支持过滤的参考词元增益作为选择标准。考虑池内的重叠和按州路由进一步提高学生的准确性。推理仅使用经过蒸馏的学生。