论文
采样词元反向-KL 同策略 蒸馏 的 词元级 分析
A Token-Level Analysis of Sampled-Token Reverse-KL On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 使用来自冻结教师的 词元级 信号来监督学生自己的轨迹,但采样损失如何在词元之间分配更新仍然知之甚少。我们分析了反向 KL 的每个词元 K2 估计器相对于学生 logits 的梯度。该梯度的 $\ell_1$ 范数分解为绝对教师-学生对数概率差距和学生侧 softmax 因子,该因子随着采样词元在学生下的可能性变得较小而增长。在我们的 math-蒸馏 运行中,这些每个词元的规范高度不统一:低学生概率词元在其总和中占据了不成比例的份额,并且在教师与学生之间的巨大差距中也得到了丰富。作为本分析建议的轻量级干预措施,我们研究了惊喜感知重新加权(SuRe),这是一种独立的、有界的加权规则,可进一步放大现有的分配。在两个 Qwen3 学生量表中,SuRe 比普通 OPD 改进了多个数学指标,并且在选定的域外基准上没有表现出明显的退化。因此,我们的主要贡献是使用 K2 估计器训练的反向 KL OPD 的梯度级表征,其中 SuRe 作为一个经验实例。