论文
Δ-MOPD:通过教师新增能力进行多教师在线蒸馏
Composing What Each Teacher Learned: Multi-Teacher On-Policy Distillation through Teacher-Relative Shifts
摘要
多教师同策略蒸馏(MOPD)用于两类设置。共同领域组合中,多个教师为同一提示领域的每条学生Rollout评分,合成单一目标;路由领域蒸馏中,不同领域提示交给对应专长教师。二者通常传递教师的最终策略,将后训练获得的变化与底座继承的偏好混合。我们提出Δ-MOPD,把每个教师相对底座的Logit变化重新锚定于学生冻结的初始模型;在教师选择固定时,于两类设置中与最终策略监督比较。首先揭示阻碍最终策略迁移的机制:继承的底座吸引可能强于后训练变化。去除它会降低教师项范数比和目标—学生KL。实验表明,多个教师信号在同一状态组合时,变化目标尤其有用。三个教师组合时,Δ-MOPD的数学及五基准成绩分别比最终策略组合高4.11和1.95分;两个教师时准确率相当。分阶段路由下,两种阶段顺序的平均表现均提高,观察到的顺序差距从10.50分缩小到6.42分。交错路由中每次更新只用一个教师,两种目标表现相近。分阶段结果支持收益可能扩展到跨训练阶段累积的信号。因此,目标构造是MOPD中独立于教师选择、与之互补的设计维度。