论文

KL 的 KL:同策略 蒸馏 与控制变量基线

KL for a KL: On-Policy Distillation with Control Variate Baseline

摘要

同策略 蒸馏 (OPD) 已成为 大语言模型 的主导 后训练 范例,特别是对于推理领域。然而,由于单样本蒙特卡罗估计量的梯度方差较高,OPD 在实践中仍然不稳定,并且稳定训练的方法仍然不成熟。我们提出了 vOPD(带有控制变量基线的 同策略 蒸馏),它将 OPD 转换为策略梯度 RL,并通过引入来自 RL 文献的控制变量基线(典型的价值函数)来稳定它。我们表明,OPD 值函数承认一个封闭形式,即学生和教师之间的每个词元负反向 KL 散度,可以直接从已经计算的前向传递中获得,无需额外的批评或推理。现有的稳定方法要么计算整个词汇表上的完整 词元级 反向 KL,从而增加显着的开销,要么将其限制为 top-k 支持,从而使目标产生偏差。相反,vOPD 保留了轻量级单样本估计器,减去作为分离基线的值函数,以保持梯度无偏,同时减少方差。此外,我们还表明,基线的 top-k 近似可以进一步降低成本,而不会影响性能。在数学和科学推理基准中,vOPD 始终优于普通 OPD,并匹配最昂贵的全词汇基线,通过有原则的 RL 方差减少提供 同策略 蒸馏 的有效稳定。