论文
当削波反向修正时:逐点前向-KL 顺on-policy自蒸馏的失效动力学
When Clipping Reverses Correction: Failure Dynamics of Pointwise Forward-KL On-Policy Self-Distillation
摘要
按策略自我蒸馏(OPSD)使用来自以特权信息为条件的同一模型的反馈来训练学生自己生成的响应。在数学推理方面,最初的 OPSD 研究发现,风格标记可以主导训练信号而不是数学相关标记,并且前向 KL 目标的逐点裁剪可以稳定训练。在对词汇表求和之前,逐点裁剪将每个词汇表前向 KL 项限制在固定阈值。后续研究采用了这种剪裁,但尚未直接检验其对训练的影响。在匹配的训练运行中,仅在是否应用裁剪方面有所不同,我们观察到,与未裁剪的运行相比,裁剪的运行产生的重复次数要多得多,并且持续到响应结束。我们将这一失败归咎于目标被剪裁。我们证明,被剪裁的目标可能无法纠正学生对老师的看法,而是会将被剪裁和未剪裁的标记概率推离老师。我们的训练运行与这种分析一致:在重复中,被剪裁的学生离开重复的可能性比其老师要低,而继续重复的可能性更大,而未剪裁的学生则与老师保持接近。