论文
您的老师无法在这里帮助您:在 同策略 蒸馏 中对抗监督保真度衰减
Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation
摘要
同策略 蒸馏 通过使用教师的 词元级 反馈在其自己生成的轨迹上训练学生模型来传输推理能力。然而,我们发现了一个关键瓶颈,\textbf{监督保真度衰减(SFD)}:随着学生生成的前缀的延长,教师的下一个词元分布变得不那么自信,也越来越不具有辨别力。因此,反向 KL 蒸馏 中依赖于教师的纠正信号减弱,导致学生在长推理链上出现漂移。为了减轻 SFD,我们引入了 \textbf{Lookahead Group Reward (\ours{})}。基于下一步教师信心反映了未来反向 KL 监督的判别力的洞察力,\ours{} 通过学生在后续步骤中引发的教师信心来评估学生的前 K 个候选标记,并分配群体标准化奖励。为了保持计算效率,我们进一步设计了一种熵触发的树注意机制。在六个数学和代码基准测试中,\ours{} 比 7B 学生的 OPD 提高了 Mean@8 \textbf{2.57} 点,并且在较长一代中收益不断增加,并在 AIME-26 上以 39k 词元达到 +\textbf{4.92} 点。