论文
ReTaCo:按策略蒸馏的残余目标控制
ReTaCo: Residual-Target Control for On-Policy Distillation
摘要
在策略蒸馏(OPD)使用词元级教师反馈来训练学生自己生成的前缀,但传输或存储教师在每个词元上的完整词汇分布的成本很高。熵感知 OPD (EOPD) 增加了反向 KL 的前向监督,以帮助学生恢复其低估的合理词元,仅使用教师的 top-$k$ 概率来限制成本。因为 EOPD 重新规范化了这些概率,所以它的目标不会为省略的词汇分配质量。我们证明,即使学生与 top-$k$ 集合中教师的相对概率相匹配,由此产生的损失也会不断将学生的 top-$k$ 质量推向 1,因此只要省略的标记具有正的教师概率,教师本身就不是静止点。我们提出 ReTaCo(残差目标控制),它将前 $k$ 标记单独保留,并将剩余标记分组为一个残差符号,并将该前向目标与单样本估计器配对,该估计器的期望等于全词汇表反向 KL。对于教师 top-$k$ 质量 $m$,$β\in[0,1]$ 的剩余目标为 $(1-β)(1-m)$:$β=0$ 保留教师的质量,较大的 $β$ 将更多质量移动到 top-$k$ 标记上,而不改变其相对概率。在固定前缀下,我们证明种群目标具有唯一的最优值,其 top-$k$ 质量位于 $m$ 和 $m+β(1-m)$ 之间,并随 $β$ 单调增加;在 $β=0$ 时,被低估的 top-$k$ 词元仍然收到非消失的恢复梯度。数值优化证实了这些预测,并且在三个师生对中,ReTaCo 在大多数数学和代码基准测试中都优于 EOPD。