论文

GammaOPD:结合可验证奖励的同策略蒸馏时序信用分配

Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation

摘要

同策略蒸馏(OPD)已成为大型语言模型后训练的有效方法,但现有目标面临着客观保真度和优化稳定性之间的权衡。词元级 OPD 提供稳定但局部的监督,而序列级 OPD 以水平相关方差为代价捕获未来信用。我们建立了这些公式的统一时间信用视图,表明实际的标记级 OPD 可以解释为序列级反向 KL 梯度的时间近似。在此基础上,我们提出 $γ$OPD (GammaOPD),它使用贴现时间信用分配来平衡长期监督和优化稳定性,同时承认与水平无关的方差界限。我们进一步为$γ$OPD开发了一种奖励兼容的有界混合(RBM)机制,该机制平衡了可验证的结果反馈与贴现的OPD优势,以超越纯粹依赖于教师的优化。数学和代码推理实验表明,在普通、大小不匹配和多教师蒸馏设置中,现有 OPD 方法得到了一致的改进。