论文
关于同策略 蒸馏的几何
On the Geometry of On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 越来越多地用于改进 大语言模型 推理,但其训练动态仍然知之甚少。我们描述了参数空间中 OPD 更新的轨迹,并将其与有监督的 微调 (SFT) 和具有可验证奖励的强化学习 (RLVR) 进行比较。一套参数空间诊断始终将 OPD 置于宽松的非主状态:与 SFT 相比,其更新影响更少的权重并更强烈地避免主方向,而与 RLVR 相比,它们的约束仍然不那么严格。除了这种静态定位之外,OPD 还表现出子空间锁定:其累积更新迅速进入狭窄的低维通道。将训练限制在训练早期形成的更新子空间可以保留 OPD 性能,但会大大降低 SFT,这表明锁定的子空间在功能上足以满足 OPD 的需要。控制实验进一步表明,稀疏更新词元和转移执行轨迹生成 离策略 保留了排名动态,而将 OPD 目标与 RLVR 混合会改变它们。总的来说,这些结果表明 OPD 不仅仅是 SFT 和 RLVR 之间的中间点,而且在参数空间中引入了自己的更新几何结构。