论文
轨迹精化蒸馏
Trajectory-Refined Distillation
摘要
同策略蒸馏 (OPD) 已成为大型语言模型 (LLM) 的核心后训练工具,在学生自身采样过程中提供密集的每个词元教师监督。在这项工作中,我们确定了 OPD 背后的一个常见结构原因,我们称之为前缀故障。在前缀失败的情况下,密集的每个词元监督会导致双峰教师混合和碎片梯度,而词元级损失截断或重新加权无法解决这些问题。这一观察促使我们超越词元级别的损失干预,转向轨迹级别的输出修正。因此,我们提出了轨迹精炼蒸馏(TRD),这是一种轨迹级别的校正方法,可以在老师的指导下同时同策略支持下修改学生的执行轨迹。通过在蒸馏之前纠正有问题的前缀,TRD 从源头上减轻了前缀故障。此外,TRD 通过在教师指导下让学生接触替代的有效推导来改进探索,即使原始卷已经正确。 TRD 还可以应用于同策略自蒸馏 (OPSD),这是一种参数共享变体,它使用以特权信息为条件的学生模型作为教师。在多个尺度的各种基准和基础模型中,TRD 始终优于先前的基准,提高了单次尝试的准确性并扩大了推理覆盖范围。代码可在 https://github.com/louieworth/trd 获取
