论文

OPD+:重新思考 同策略 蒸馏 的优势设计

OPD+: Rethinking the Advantage Design for On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 是一种广泛使用的技术,用于将功能从有能力的教师语言模型转移到基础学生模型,并且可以使用学生生成的轨迹采样以强化学习风格目标来制定。然而,尽管发散奖励取决于学生模型的可能性,但现有的工作通常主要为了稳定性而采用停止梯度设计,这使得由此产生的优势估计值得怀疑。在这项工作中,我们提供了一个基于学生和教师之间的 f 散度的通用优化框架,并从数学上重新审视了这种设计空间是否有效。我们证明,一般停止梯度操作会导致对一般散度函数的奖励目标和相应梯度的估计有偏差。我们提出 OPD+,这是 OPD 的修正版本,它比基线 KL 方法表现出更好的性能,并且还支持各种 f 散度的选择。我们验证了数学推理和工具使用基准的发现。