论文

M3:协调稀疏奖励与密集on-policy蒸馏的训练动力学

When Sparse Reward Meets Dense Distillation: Training Dynamics of On-Policy Distillation

模型训练强化学习

摘要

带可验证奖励的强化学习提供稀疏后训练信号:单个二元结果评估整个rollout,无论各词元的实际贡献如何,它们都获得相同的序列级优势。为补充这种稀疏监督,越来越多方法向策略梯度目标加入标量加权的教师KL项,提供密集的词元级指导,但这种指导在某些位置可能并不可靠。虽然结合两种信号有益,它们在优化中的相互作用也可能使联合训练失稳。为理解这一过程,我们通过神经切线核(NTK)分析研究奖励与蒸馏混合训练的学习动力学。我们引入跨信号NTK K_DR(n),这一词元级统计量衡量位置n处奖励梯度与蒸馏梯度的对齐程度,并识别两种失效模式:第一,幅度淹没,即奖励梯度比蒸馏梯度大几个数量级,以至于即使方向冲突很弱,也会让显式纳入目标的蒸馏损失上升;第二,局部方向冲突,即序列级优势与教师在特定位置的分布对同一词元产生相反更新(K_DR(n)<0)。这些效应的严重程度取决于优化设置:梯度范数比κ=‖∇L_R‖/‖∇L_D‖在不同任务间约相差一个数量级,实验发现一个经验阈值,超过该阈值后,简单混合可能导致持续训练崩溃。基于这些发现,我们提出M3系列,将幅度归一化与三种协调密集教师监督和稀疏奖励更新的策略结合:仅保留兼容教师信号的NTK硬掩码(M3-Select)、该掩码的连续松弛(M3-Soft),以及在时间上分离教师塑形与奖励修正的快慢外梯度步骤(M3-EG)。四种模型骨干和四个基准上的实验表明,在标量混合基线发生崩溃的高κ设置下,M3能够保持稳定训练动力学,并取得更好的表现。