论文
不完美教师下离线同策略蒸馏的轨迹可学习性
Trajectory Learnability for Offline On-Policy Distillation with Imperfect Teachers
摘要
离线在线策略蒸馏通过收集一次学生轨迹和教师监督并在整个优化过程中重复使用来提高效率。同样的重用使得不完善的监督持续存在。由于即使是优秀的教师也可能失败,我们问\emph{从不完善的教师监督中还能学到什么?}教师的失败只是一个粗略的问题级信号,并不意味着沿着相关学生轨迹的所有监督都是无益的。一个自然的替代方案是沿着轨迹估计教师的可恢复性,但重复的延续很大程度上消除了离线蒸馏的效率优势。相反,我们使用教师成功的问题来定义学生可以学习的廉价参考。我们对教师成功的问题进行训练,并测量教师失败的问题轨迹中每个观察到的标记的可能性如何变化。我们使用这些带符号的似然变化作为可操作的\emph{学习能力信号}:较大的增加表明仅成功学习对行为的促进作用更强。我们将该信号聚合为原始蒸馏损失的轨迹级权重。与基于连续的估计不同,我们的可学习性不需要额外的生成,并且可以根据存储的轨迹和模型检查点计算一次。在数学推理和代码生成方面,我们的方法将离线 OPD 基线提高了高达 2.7 个百分点,并且在多个基准测试中匹配或优于在线 OPD 变体。尽管有额外的仅成功蒸馏阶段,但它使用 2 个 GPU 和大约 22 个 GPU 小时,而代表性在线 OPD 方法需要 3 个 GPU 和 36--48 个 GPU 小时。