论文
传递接力棒:轨迹中继 同策略 蒸馏
Pass the Baton: Trajectory-Relayed On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 将 词元级 监督置于学生自己的轨迹中,但会遭受前缀失败:一旦学生做出错误的推理方向,所有后续生成都会建立在这种偏差之上,产生误导的延续,从而引发不可靠的监督和浪费计算。我们发现了失败前缀上的师生继续不对称性,即教师倾向于重定向,而学生继续沿着原始方向继续,并将其转换为 Relay 同策略 蒸馏 (Relay-OPD) 中的无标签切换触发器。在训练期间,Relay-OPD 通过让教师在检测到的触发点短暂接管以产生教师腿来构建接力轨迹,之后学生恢复并在生成的轨迹上进行优化。有限的接力预算将干预集中在关键的早期位置,同时限制对学生政策的偏离。在 Qwen3-4B-Instruct-2507 教师和 Qwen3-0.6B/1.7B-Non-Thinking 学生的八个数学推理基准测试中,Relay-OPD 在每个基准测试中都取得了最好或第二好的结果,比标准 OPD 多出 +5.73%,比最强基线 FastOPD 平均 1.7B 多出 +1.49%,并始终保持 0.6B 的增益。训练轨迹长度减少 50% 以上。