论文
阶梯级 同策略 蒸馏:在 同策略 蒸馏 和受监督 微调 之间进行插值
Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning
摘要
同策略 蒸馏 (OPD) 将学生模型与教师在学生生成的轨迹上的 logits 分布对齐。这种方法取得了巨大的经验收益,并且通常可以用更少的数据超越传统的 离策略 蒸馏。然而,标准的词元级 OPD只能沿着错误的学生轨迹提供碎片化的修正,无法展开完整且正确的修复路径。受此限制的启发,我们提出 \emph{Step-Level 同策略 蒸馏} (SOPD),它将监督 微调 (SFT) 的长范围校正与 OPD 的 同策略 优势结合起来,为完整的学生生成的轨迹提供阶梯级监督。我们表明,在不同的步长限制下,SOPD 可以简化为 SFT 或近似 OPD。与 SFT 相比,SOPD 中教师的反应以学生轨迹为条件,因此与学生访问过的状态更加一致;与 OPD 相比,SOPD 提供了更长范围的修正,而不是零散的 词元级 指导。在推理和代理任务中,SOPD 的性能远远优于传统的 SFT 和 OPD。例如,在 ALFWorld 上,SOPD 的平均成功率比 Vanilla OPD 提高了 13.4 个百分点。我们希望这项工作为 蒸馏 方法的未来研究提供新的视角。