论文
尾部感知顶部-$k$ 同策略 蒸馏
Tail-Aware Top-$k$ On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 已成为在语言模型之间转移知识的有效范例,其中学生接受训练,使其下一个标记的分布与教师沿着自己的轨迹的分布保持一致。为了以易于处理的成本提供密集的监督,许多工作最小化了学生和教师在教师的 top-$k$ 词元上的标准化分布之间的反向 Kullback-Leibler (KL) 差异。然而,这个归一化目标丢弃了有关尾部概率的信息:教师的 top-$k$ 标记之外的总概率。因此,优化可以稳定地增加学生的尾部概率和熵,从而根据经验降低下游精度。为了解决这个问题,我们提出了 Tail-Aware Top-$k$ OPD (\textbf{TA-OPD}),这是一种新颖的 蒸馏 方法,可以恢复丢失的尾部概率信号。特别是,TA-OPD 最小化了 top-$k$ 词元加上带有尾部概率的尾部词元的反向 KL 散度。实际上,TA-OPD 更好地将学生的下一个标记分布与教师的分布对齐,防止由 top-$k$ 归一化引起的尾部概率和熵的增加。大量实验证明了 TA-OPD 的优越性,在常见基准测试中将 Avg@8 提高了高达 8.05 点。我们的代码可在 https://github.com/HuipengHuang/TA-OPD 获取。