论文

反思大语言模型的同策略 蒸馏:现象学、机制和配方

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

摘要

同策略 蒸馏(OPD)已成为大语言模型的后训练的核心技术,但其训练动态仍然知之甚少。本文对 OPD 动力学和机制进行了系统研究。我们首先确定 OPD 成功或失败的两个条件:(i)学生和老师应该共享兼容的思维模式; (ii) 即使具有一致的思维模式和更高的分数,教师也必须提供超出学生在训练期间所见的真正新能力。我们通过弱到强反向 蒸馏 验证了这些发现,表明从学生的角度来看,同一家庭的 1.5B 和 7B 教师在分布上没有区别。通过对 词元级 机制的探索,我们发现成功的 OPD 的特点是在学生访问的状态下对高概率词元进行渐进对齐,这是一个集中了大部分概率质量 (97%-99%) 的小型共享词元集。我们进一步提出了两种恢复失败 OPD 的实用策略:离策略 冷启动和教师一致的提示选择。最后,我们表明 OPD 表面上的免费午餐密集的 词元级 奖励是有代价的,这提出了 OPD 是否可以扩展到长期 蒸馏 的问题。