论文

$β$-OPSD:通过策略优化进行推导,通过 Self-蒸馏 进行训练

$β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

摘要

同策略 self-蒸馏 (OPSD) 是一种很有前途的改进推理语言模型的方法,但它在实践中仍然很脆弱:使其可靠地工作通常需要大量的工程工作。我们确定了这种困难的结构性根源:普通的 OPSD 正是更广泛的政策优化家族中 $β=1$ 的成员,其中 $β$ 权重 KL 惩罚,将学生锚定到参考政策。这种等价将 $β$ 从固定为 1 的隐含值转变为可控的正则化参数,从而产生一个更通用的公式,该公式在与参考政策的接近度与特权教师指导之间进行权衡。我们引入 $β$-OPSD 并导出其最优策略作为参考策略和特权教师之间的几何插值。然而,通过强化学习直接优化这个目标将是昂贵的且高方差的。我们没有直接优化 RL 目标,而是将其封闭式解决方案转变为 蒸馏 目标。 $β$ 的每个值沿着参考教师路径选择一个目标,我们通过混合它们的 词元级 logits 来有效地实现该目标。这样,廉价的 蒸馏 就逼近了昂贵的策略优化的解决方案。 Return-to-go 信用分配进一步使词元更新与序列级目标保持一致,同时保留 OPSD 的简单性。数学推理基准实验表明,$β$-OPSD 始终优于普通 OPSD,提高了优化稳定性和下游推理性能。我们的结果提供了一条从自我 蒸馏 到策略优化并返回的原则性路线,而不会牺牲使 OPSD 实用的效率。