论文

SAKI:用于策略蒸馏的最大耦合路由教师监督

SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation

摘要

on-policy蒸馏(OPD)通过在学生自己生成的轨迹上训练学生来减少训练-测试状态不匹配,但能力较弱的学生可能会访问监督代表性较差的教师未对齐的前缀。我们引入了 SAKI(带有 KL 约束插值的监督分配),它将 KL 约束教师引导的部署与最大耦合相结合,并重用已实现的接受/纠正事件来路由词元级监督。接受的位置保留采样词元反向 KL 监督,而校正位置则接受对教师最高概率词元的直接监督。在最大耦合下,校正概率恰好为TV(p_t,q_t),因此相同的信赖域半径控制了rollout偏差以及上限干预和专门监督频率。我们进一步实现了一个引擎驻留推测验证器,它保留了精确 q 轨迹分布和耦合语义,同时将匹配工作负载rollout吞吐量提高了 4.22 倍。在七个数学推理基准测试中,SAKI 为 1.7B 和 0.6B 学生改进了 Mean@8 和 Pass@8 中匹配的教师指导基线。布局控制和固定前缀分析进一步支持校正触发路由作为冲突自适应监督信号。