论文

更密集 $\neq$ 更好:同策略 自 蒸馏 连续 后训练 的限制

Denser $\neq$ Better: Limits of On-Policy Self-Distillation for Continual Post-Training

模型训练持续学习

摘要

Continual 后训练 使基础模型能够获取新知识,同时保留现有功能。最近的研究表明,同策略 学习可以减轻遗忘,同策略 自 蒸馏 成为一种特别有吸引力的方法。在这项工作中,我们通过自我 蒸馏 策略优化(SDPO)重新审视这种乐观观点。我们的实验表明,当教师信号稳定且对齐良好时,SDPO 可以加速域内专业化,但它很难推广到分布外的场景。在连续的 后训练 中,SDPO 表现出更强的遗忘,甚至可能崩溃,而 同策略 强化学习方法(例如 GRPO)的适应更加保守,更好地保留先前的能力。进一步的分析表明,更密集的自蒸馏会在参数空间和响应空间中引起更大的漂移,并且可以通过自我强化的师生循环放大高频格式化伪影。这些发现表明,仅 同策略 数据不足以持续学习。当教师目标稳定且 词元级 监督可靠时,密集自我 蒸馏 可以加速专业化,但不应将其视为连续 后训练 的默认稳定器。我们的代码可在 https://github.com/Moenupa/SDPO-CL 获取。