论文

TISD:教师分支干预扩展自蒸馏后继上下文

TISD: On-Policy Self-Distillation with Trajectory Intervention

摘要

同策略自蒸馏 (OPSD) 提供了密集的教师目标,但仅根据学生采样的轨迹对其进行评估。当特权教师倾向于在访问的前缀处采取替代操作时,OPSD 可以为分支决策提供目标,但无法监督该操作引起的后继上下文,除非学生对其进行采样。这造成了训练时数据收集的瓶颈,并为师生分歧提出了不同的角色:提出轨迹分支而不是确定足够的局部修复。我们使用受控令牌干预的诊断框架表明,在分歧最大时教师首选的令牌可以提高学生的继续成功率,而其局部纠正价值是有限的。受这一发现的启发,我们引入了一种简单的分支重新生成蒸馏算法,即轨迹干预自蒸馏(TISD)。 TISD 强制执行教师选择的分支操作,将后缀生成返回给学生,并在特权上下文条件下的教师监督下蒸馏完整轨迹。在所有编码模型中,TISD 的平均 Avg@4 比 SDPO 提高了 1.2 个百分点。在整个科学领域,它在等步预算下将平均 Avg@128 提高了 0.8 个点,在等时间预算下将平均 Avg@128 提高了 0.3 个点。这些结果支持教师引导的分支作为暴露有用的后继上下文以进行自我蒸馏的一种方式。

失败代码生成轨迹中,学生与教师token语义角色在干预点的转换分布。
图11(图注摘要):失败代码生成轨迹中,学生与教师token语义角色在干预点的转换分布。