论文
并非每个词元都值得蒸馏:Direct-OPD的选择性监督
Not Every Token Is Worth Distilling: Selective Supervision for Direct-OPD
摘要
直接策略蒸馏 (Direct-OPD) 通过使用 RL 后和 RL 前检查点之间的词元级对数比率作为对学生自己的部署的密集监督,将强化学习引起的策略改进从小模型转移到更大的学生。这种转移奖励每个状态的政策转变,但对数比率仅衡量相对变化:即使两个检查点分配给学生候选词元的概率质量消失,它也可以保持固定。通过精确的构造,我们表明 Direct-OPD 奖励及其更新可以保持不变,而检查点之间的 Jensen-Shannon 散度 (JSD) 和两个 KL 方向会随着这个质量而消失,并且我们注意到,小的 JSD 限制了教师行为变化的程度。受此分析的启发,我们提出了 Direct-OPD 的选择性监督 (S$^2$D-OPD),它根据教师参考的 JSD 对学生采样的状态进行排名,并屏蔽低分歧状态的直接 OPD 监督,仅保留每个响应的前 10% 的状态。在参数范围从 1.7B 到 8B 的两个教师对和四个学生模型中,S$^2$D-OPD 在 AIME 和 HMMT 基准测试中,在八个设置中的七个设置中比密集 Direct-OPD 提高了保留精度,并在第八个设置中与之匹配,无需额外的前向传递。我们的代码可以在这个 https URL 上找到。