论文
共享前缀隐藏了什么:on-policy蒸馏中的轨迹Dropout
What Shared Prefixes Hide: Trajectory Dropout for On-Policy Distillation
摘要
on-policy蒸馏 (OPD) 使用来自更强大的教师模型的密集词元级反馈,按照自己的轨迹训练学生模型。由于每次更新都以学生已经生成的推理前缀为条件,因此前缀还决定了教师反馈转化为学习的效率。我们发现共享前缀可能导致词元级别更新较弱,我们将这种现象称为前缀诱导监督衰减(PISA)。这种衰减在两种常见情况下出现。 (i) 即使老师不同意,学生的高信心也会削弱纠正梯度。 (ii) 依赖于早期推理的词元可以接收与简单局部延续一样弱的学习信号。为了解决这个问题,我们提出了 Trajectory Dropout,这是一种简单的训练时干预,可以暴露这些减弱的信号。学生首先执行标准的全上下文rollout以生成完整的轨迹。在训练过程中,我们随机丢弃一定比例的学生推理轨迹,而老师则继续观察完整的轨迹进行词元级监督。这种干预加强了对过度自信预测的纠正,并对前缀敏感的位置引入了额外的监督。 Trajectory Dropout 持续提高了不同规模的师生模型对和六个数学推理基准的平均性能,同时还在两个域外基准上产生了收益。它还可以灵活地集成到现有的 OPD 变体中,计算开销可以忽略不计,进一步提高其性能。这些结果表明,Trajectory Dropout 提供了一种简单的机制,可以加强跨模型规模和 OPD 目标的词元级监督。