论文
同策略蒸馏中的位置偏差
On the Position Bias of On-Policy Distillation
摘要
同策略蒸馏OPD通过教师提供密集的词元级监督,提高标准强化学习的学习效率。其标准KL目标均匀平均词元损失,意味着所有词元权重相同。本文发现随着学生生成轨迹增长,其分布进一步偏离教师,后段位置的监督质量降低。因此,仅用前30%词元训练即可接近全词元训练表现,而仅用后30%词元几乎无法学习。研究从约束优化角度解释这一问题,并推导重要性加权同策略蒸馏IW-OPD。每个词元权重取决于师生分布的累积差异,自然提高前段权重,降低偏离较大的后段权重。IW-OPD比OPD更快收敛、学习效率更高,在同规模及跨规模设置下最终表现更好,AIME-2025最高提升6.9分。