论文

非对称 同策略 蒸馏:在 词元级 上桥接利用和模仿

Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

摘要

同策略 蒸馏 (OPD) 通过 词元级 教师反馈按照自己的轨迹训练学生,并且通常优于 离策略 蒸馏 和标准强化学习。然而,我们发现其标准优势加权策略梯度存在三个结构性弱点,包括高方差更新、零优势区域的梯度消失以及纠正信号不足时的探索瓶颈。因此,我们提出非对称 同策略 蒸馏 (AOPD),它用非正优势区域的局部发散最小化取代无效的负强化,同时保留正强化学习。数学推理基准实验表明,AOPD 始终优于标准 OPD,在强/弱初始化下平均增益分别为 4.09/8.34。 AOPD 还在训练期间保持较高的策略熵,并在顺序工具使用适应期间保持更好的能力保留。