论文

少即是多:提前停止轨迹采样 同策略 蒸馏

Less is More: Early Stopping Rollout for On-Policy Distillation

摘要

同策略 蒸馏 最近成为标准序列级模仿的有前途的替代方案,通过使用教师模型对学生自己的展示进行评分来训练学生。然而,我们在这种范式中观察到“离策略 教师衰减”问题:对于后面的标记,以学生的早期轨迹作为上下文(对于教师来说是 离策略),教师产生纠正分数的能力将会衰减,并且可能会退回到在 预训练 阶段学习的标记完成行为。我们根据经验验证了这个问题,并提出了提前停止轨迹采样(ESR)来解决它:一个简单而有效的 蒸馏 策略,只需将轨迹采样生成限制为第一个响应词元。我们表明,ESR 不仅在模型大小、系列、任务和训练机制方面超越了全面轨迹采样的 OPD 性能,而且表现出更高的 GPU 效率和训练稳定性,特别是在跨模型系列场景下。我们进一步研究了这种令人惊讶的表现背后的机制,发现了 ESR 的“级联对齐”和“子模式承诺”效应,这可以解释为什么它有效,甚至有时超过教师模型的表现。此外,我们表明这种基于位置的词元选择策略不能完全用 KL 散度和熵信号来解释。