论文
OPD 博士:学习如何遵循大语言模型的最佳在策略蒸馏
Dr. OPD: Learning What to Follow for Optimal On-Policy Distillation of Large Language Models
摘要
on-policy蒸馏(OPD)使用更强大的老师的密集、词元级监督来训练学生自己生成的响应。 Vanilla OPD 平等对待所有教师信号,假设教师的监督对于每个标记都同样重要。然而,不同标记处的教师信号可能对学生的表现产生截然不同的影响:一些纠正了重要的推理错误,而另一些则对最终答案几乎没有影响。受这一观察的启发,我们引入了 OPD 博士(OPD Done Right),它定义了最佳加权 OPD,以最大限度地提高学生的表现。我们将 Dr. OPD 表述为一个双层优化问题,其中学生从加权教师监督中学习,同时选择权重以最大化最终学生的预期奖励。为了解决 Dr. OPD,我们开发了一个高效的迭代求解器,可以交替更新词元权重和学生策略。在每一轮中,它都会以封闭形式更新权重,然后对生成的加权 OPD 目标采取一个梯度步骤。在规律性条件下,我们表明这种加权更新比普通 OPD 更新获得了更高的预期奖励。根据经验,在数学和代码的从强到弱和相同规模的蒸馏中,OPD 博士始终优于所有评估的基线。特别是,在从强到弱的蒸馏设置中,OPD 博士将平均数学成绩比普通 OPD 提高了 9.7 美元,并且使较小的学生超越了较大的老师。