论文
Simple-OPD:同策略 蒸馏 的揭秘热身
Simple-OPD: Demystifying Warm-up for On-policy Distillation
摘要
同策略 蒸馏 (OPD) 在教师模型的 词元级 监督下自行训练学生,但其有效性在很大程度上取决于 OPD 之前的预热阶段。在本文中,我们从数据和训练的角度揭开了 OPD 预热的神秘面纱。对于数据,我们发现有效的热身依赖于与教师兼容的思想链监督,即使是不正确的教师展示也可以提供与正确的教师展示相当的好处。这表明热身主要传递与教师兼容的思维模式,而不仅仅是正确答案。对于训练,我们表明,与全参数 SFT 相比,具有接近饱和训练持续时间的低秩自适应 (LoRA) 可以更好地平衡域内自适应和分布外泛化。基于这些发现,我们提出了 Simple-OPD,这是一种即插即用的初始化方法,可以在 OPD 之前使用 LoRA 为学生预热教师生成的 CoT。不同环境下的实验证明了 Simple-OPD 的有效性和鲁棒性。