论文
学会预见:揭秘同策略 蒸馏的解锁效率
Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 已成为 大语言模型 的高效 后训练 范例。然而,现有的研究很大程度上将这种优势归因于更密集、更稳定的监督,而 OPD 效率背后的参数级机制仍然知之甚少。在这项工作中,我们认为 OPD 的效率源于一种“远见”:它在训练的早期就为最终模型建立了稳定的更新轨迹。这种远见体现在两个方面。首先,在模块分配级别,OPD 识别边际效用较低的区域,并将更新集中在对推理更关键的模块上。其次,在\textbf{更新方向级别},OPD 表现出更强的低秩集中性,其主导子空间与训练早期的最终更新子空间紧密对齐。基于这些发现,我们提出了 \textbf{EffOPD},一种即插即用的加速方法,通过自适应地选择外推步长并沿着当前更新方向移动来加速 OPD。 EffOPD 不需要额外的可训练模块或复杂的超参数调整,并且可以实现 $3\times$ 的平均训练加速,同时保持可比较的最终性能。总体而言,我们的研究结果为理解 OPD 的效率提供了参数动力学视角,并为为 大语言模型 设计更高效的 后训练 方法提供了实用见解。