论文

我们什么时候需要按策略蒸馏?线下学生推广的提炼通常更好

When Do We Need On-Policy Distillation? Distilling on Offline Student Rollouts Is Often Better

摘要

在策略蒸馏(OPD)将教师能力转移到学生模型方面变得越来越流行。在这项工作中,我们提出了一个关键的研究问题:同政策抽样是否总是有利于提取任意的师生对?我们证明了一种简单的替代方案,Semi-OPD,它从初始学生生成的离线部署中提炼出来,在准确性和训练效率方面通常可以优于 OPD。在参数范围从 1.5B 到 235B 的 17 个师生对中,Semi-OPD 在 14 个案例中优于 OPD,准确率高达 +13.6%,训练速度提高了 11.4 倍。我们进一步发现,OPD 和半 OPD 之间的选择取决于初始教师和学生之间的对齐,通过输出token重叠率进行量化:只有当两者高度对齐且重叠率高时,OPD 才是有益的。我们更深入的调查表明,有效的蒸馏需要符合政策。无论是学生还是老师。对于错位的配对,学生的推出可能会变得越来越不符合政策。随着上下文长度的增长,老师 减弱蒸馏信号。相比之下,Semi-OPD 通常更稳定,因为它在较短的上下文中进行提炼,同时覆盖完整的轨迹并使学生接触到更多教师偏好的标记。除了提出半 OPD 作为一种有效的替代方案之外,我们的工作还促使社区重新思考何时使用 OPD 并与有意义的师生对一起研究更强的 OPD 变体。