论文

密集监督,稀疏更新:论同策略 蒸馏的稀疏性和几何结构

Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation

模型评测模型行为与机制分析

摘要

同策略 蒸馏 (OPD) 最近成为了一个著名的 后训练 配方,它结合了两种理想的成分:同策略 学生生成的轨迹和密集的 词元级 教师监督。然而,这种混合训练制度如何塑造模型仍然知之甚少。我们描述了跨多种语言和视觉语言模型对和应用程序设置的 OPD 参数更新的稀疏性和几何形状。 OPD 更新很小,并且在检查点精度上坐标稀疏,同时保持跨层和模块的分布。这种稀疏支持在操作上是有意义的:对发现的子网络进行屏蔽训练几乎可以恢复完整的训练性能。在矩阵级别,更新在数值上是满秩的,但在谱上是集中的。它们的可见支撑避免了源主要结构所强调的坐标,而有利于低幅度源坐标,而源奇异值光谱变化很小。总之,这些发现表明,尽管使用了密集的教师监督,OPD 仍表现出 同策略 后训练 的重要权重空间特征。