论文
NP-OPD:用负策略轨迹改善同策略蒸馏
On-Policy Distillation with Negative-Policy Rollouts
摘要
同策略蒸馏(OPD)作为 后训练方法已被广泛研究,其中 学生模型从其自身的 教师模型 上的更强的 教师模型 获得 token 级别的监督。最近的研究通过替代蒸馏奖励配方和 教师模型 配置改善了 OPD,而蒸馏的目标仍然集中在模仿 教师模型。然而,当更强的 教师模型 与 学生模型 的分布重叠有限时,这种积极的指导可能会提供不足的学习信号。在这项工作中,我们引入了 Negative-策略 OPD (NP-OPD),它通过 执行轨迹 补充了 教师模型 监督,该监督来自性能较低、能力较低的负策略,充当 学生模型 的负参考。 NP-OPD 没有修改蒸馏奖励公式,而是在 执行轨迹 阶段引入负策略,持续提供负策略优先于 教师模型 的 token,以便它们在整个训练过程中始终暴露在 教师模型 监督之下。这通过负策略执行轨迹 提供显式负信号,同时保留 OPD 中使用的正 教师模型 监督。通过大量的实验,我们表明 NP-OPD 在模型尺度、生成模式、推理领域和不同的 OPD 变体上改善了 OPD。此外,我们的分析表明,NP-OPD 有效抑制负策略优先于 教师模型 的 token,并使 学生模型 远离负策略。这些结果支持我们通过负策略执行轨迹 引入负信号的设计,并为 执行轨迹策略在 OPD 中的作用提供了新的见解。代码可在 https://github.com/naver-ai/np-opd. 获取
