论文
大语言模型 的分布校正离线数据 蒸馏
Distribution Corrected Offline Data Distillation for Large Language Models
摘要
将推理痕迹从强大的 大语言模型 提炼成较小的痕迹是在资源有限的环境中提高智力的一条有前途的途径。现有方法面临着一个根本性的权衡:来自教师生成轨迹的离线 蒸馏 提供了高质量、样本高效的监督,但受到分布漂移的影响:在训练期间,学生模型以教师生成的前缀为条件,而在推理过程中,学生对自己生成的前缀进行自回归,从而导致长推理轨迹上的复合错误。同时,同策略 或自 蒸馏 方法更好地匹配学生的推理时间分布,但需要昂贵的在线采样,并且在早期训练中经常产生低质量的跟踪。我们提出了一个有原则的离线推理 蒸馏 框架,该框架可以保留离线教师生成数据的效率和监督质量,同时纠正师生分布漂移。它自适应地强调教师监督,更好地符合学生的 同策略 分布。对 GSM8K、MATH、MATH500 和更难的竞赛型任务(包括 AMC、AIME 和 OlympiadBench)的数学推理基准的评估表明,我们的方法比之前的离线 蒸馏 算法提高了推理精度,并在保留指令跟踪能力的同时产生更稳定的推理轨迹。我们的工作表明,轻量级、分布校正感知训练可以显着增强离线推理 蒸馏,而无需在线部署。