论文
面向在线策略蒸馏的师生差异校准
Calibrating Teacher--Student Discrepancy for On-Policy Distillation
摘要
在线策略蒸馏(OPD)通过学习更强教师与当前策略学生之间的token级差异来改进推理模型。然而,这种差异并非纯粹反映师生间的能力差距:它还包含源自教师自身的偏移,这些偏移混入观测到的师生差异,并被标准OPD在训练中不加区分地学习。特权OPD进一步加剧了该问题——特权信息引发更大的教师侧似然偏移,从而鼓励学生学习更多教师自身的偏差。我们提出校准式在线策略蒸馏(Cal-OPD),通过正负特权干预估计教师自我偏移区域,并仅保留超出该区域的成分来校准原始师生差异。在数学推理基准上的实验显示,尽管仅保留约52–65%的原始师生差异作为优化信号,Cal-OPD在各模型规模上均持续优于标准OPD及其变体。
