论文

AsyncOPD:同策略 蒸馏 有多陈旧?

AsyncOPD: How Stale Can On-Policy Distillation Be?

摘要

同策略 蒸馏 (OPD) 在教师反馈的指导下自行训练学生,这对于 大语言模型 (LLM) 后训练 变得越来越重要。然而,与强化学习 (RL) 一样,OPD 面临着 同策略 系统瓶颈,因为部署可能会占据推理工作负载的训练时间。异步训练管道可以通过将轨迹生成与学习者更新解耦来缓解这一瓶颈,但这样做会引入过时的策略数据。虽然之前的工作研究了异步强化学习中的陈旧数据,但其对 OPD 的影响仍未得到充分探索。我们提出了第一个关于异步 OPD 中陈旧性的系统研究,重点关注实际环境,其中教师反馈是通过本地 KL 损失实现的,而全词汇教师 logits 的存储或传输成本太高,需要有限的教师分数缓存。我们首先表明 KL 方向改变了陈旧数据问题:教师加权的正向 KL 对于陈旧的部署更稳健,而学生加权的反向 KL 很脆弱。其次,对于这种易受攻击的反向 KL 案例,我们研究了旨在稳定异步 RL 的方法是否可以减轻 OPD 陈旧性。在我们的实验中,它们并没有比更简单的 OPD 特异性替代方案有所改进:在学习者时间重新计算当前学生下的反向 KL 信号。第三,我们分析有限的教师分数缓存如何为稀疏和采样的反向 KL OPD 估计器创建偏差-方差权衡。这激发了多样本蒙特卡罗 (MC),它保留了 MC 的可校正性,同时减少了单样本方差。最后,我们提出并开源 AsyncOPD,这是一个根据这些估计器选择构建的完全异步 OPD 训练管道。实验表明,与严格的同步训练相比,AsyncOPD 将训练吞吐量提高了 $1.6\times$ 至 $3.8\times$,同时达到了相当的精度。