论文
超越模仿:按推理进展过滤在线策略蒸馏
Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress
摘要
在线策略蒸馏(On-policy Distillation, OPD)已成为后训练语言模型的有效框架,它将学生生成的轨迹与来自教师的密集token级监督配对。然而,OPD隐含假设教师导出的奖励是推理进展的合适代理,因此在策略优化中对所有教师反馈一视同仁。但实际上这一假设并不总成立。我们观察到教师导出的奖励常与真实推理进展冲突:具有明确推理推进的步骤可能仍得到较低的蒸馏奖励,仅仅因为偏离了教师的输出。为解决这种错配,我们提出面向在线策略蒸馏的推理进展感知奖励过滤(R2-OPD),它构建轨迹内推理跨度的两个排序,一个来自教师导出奖励,另一个来自独立估计的进展奖励。当两个排序不一致时,选择性地抑制蒸馏奖励,减少与推理进展冲突的监督,同时保留有效的教师指导。我们的方法相对标准OPD表现出一致改进,尤其在推理性能方面。
