论文

并非所有分歧都是可以学习的:同策略 蒸馏 中的词元可教性

Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 在 词元级 教师的监督下自行培训学生。最近的选择性 OPD 方法通过优先考虑高熵或高不一致标记来利用 OPD 信号的不均匀性。我们重新审视这个原则并问:哪些 词元级 教师信号实际上是可以学习的?使用测量相同上下文师生 KL 减少的固定上下文诊断,我们表明原始 KL 分歧是学习价值的粗略代理。它将可学习的分歧(教师将纠正的质量分配给学生的前 K 候选人)与不相容的分歧(教师将质量大部分放在学生当前的支持之外)混为一谈。我们将这种局部兼容性形式化为词元可教性,并表明它比单独的原始 KL 更好地预测固定上下文的改进。受这一发现的启发,我们提出了可教性感知 OPD(TA-OPD),这是一种轻量级的词元位置选择方法,它将 OPD 损失应用于无需奖励模型或验证者的高可教性位置。在 Qwen2.5 和 Qwen 3 师生设置中,TA-OPD 通常超过仅保留 5% 词元的全词元 OPD,并且比基于熵和散度的基线有所改进。我们的结果将选择性 OPD 重新定义为选择可学习的教师信号而不仅仅是显着的标记。