论文

在线策略蒸馏的多副面孔:陷阱、机制与修复

The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes

摘要

在线策略蒸馏(OPD)与在线策略自蒸馏(OPSD)已成为大语言模型颇有前景的后训练方法,可在从模型自身策略采样的轨迹上提供稠密的token级监督。然而,关于其有效性的已有结果并不一致:OP(S)D在系统提示与知识内化方面展现出潜力,近期研究也报告了不稳定与性能退化。本文对OPD与OPSD何时有效、何时失效以及为何失效进行了全面的实证研究。我们发现,数学推理上的OPD对教师选择与损失形式高度敏感,而OPSD在我们测试的设置中因测试时缺失实例特定的特权信息(PI)而失效。相比之下,当PI代表共享的潜在规则(如系统提示或对齐偏好)时,OPSD是有效的。我们识别出三种失效机制:(1) 以学生生成的前缀为条件导致的师生分布失配;(2) 有偏的TopK反向KL梯度带来的优化不稳定;(3) OPSD特有的局限,即学生学到的是聚合各PI条件教师的无PI策略,当PI为实例特定时这并不足够。我们进一步表明,stop-gradient TopK目标、经RLVR适配的教师以及经SFT稳定化的学生可以缓解这些失效。

在线策略蒸馏的多副面孔:陷阱、机制与修复:论文配图
图 1:概述。我们绘制了 OP(S)D 设计空间(左、上)及其依赖于任务的成功/失败行为(左、下),确定了三种失败机制——前缀扭曲的教师状态、有偏见的 Top-KK 反向 KL 和 PI 边缘化 OPSD 策略(中),并提出了实际的解决方案:稳定的 Top-KK 损失、SFT 稳定和 RLVR 适应的教师(右)。