论文

同策略 Self-蒸馏 的自适应监督锚定

Adaptive Supervised Anchoring for On-Policy Self-Distillation

摘要

同策略自蒸馏 (OPSD) 通过从冻结的教师对从学生采样的轨迹中提取指导来调整语言模型。然而,其有效性关键取决于这些轨迹的质量。我们表明,当学生的执行轨迹偏离目标轨迹时,教师对偏离目标前缀的调节会大大削弱其与任务相关的监督。受控前缀损坏实验暴露了这种故障模式,我们将其称为转出条件信号退化。为了解决这个问题,我们提出了一个统一的训练框架,将两个互补的监督路径分开。第一个保留了以执行轨迹为条件的分布匹配,为学生实际访问的状态提供指导。第二个在规范的 真值 上下文上应用监督交叉熵,避免在错误的执行轨迹前缀上强加目标词元的不兼容性。 词元级 执行轨迹目标对齐用于调整规范上下文锚的强度,在冷启动期间强调它,并随着执行轨迹质量的提高而放松它。跨多个模型尺度、两个任务族和一般推理基准的实验表明,所提出的方法比 OPSD 改善了任务获取,同时保留了一般能力,从而产生了更有利的经验可塑性-稳定性权衡。这些发现将上下文质量确定为 同策略 自 蒸馏 的中心瓶颈,并证明了将执行轨迹条件指导与规范监督分开的价值。