论文
CompassOPD:通过家庭内似然变化实现跨家庭 同策略 蒸馏
CompassOPD: Cross-Family On-Policy Distillation via Within-Family Likelihood Shifts
摘要
同策略 蒸馏 (OPD) 对学生生成的轨迹提供密集的 词元级 监督。尽管当教师和学生属于同一模型家庭时,OPD 表现强劲,但我们发现,即使在标记器对齐之后,它的有效性在跨家庭环境中也会下降,而更强大的外部教师几乎没有提供额外的改进。为了理解这种脱节,我们将跨家庭 OPD 信号分解为两个组成部分:低能力教师家庭参考与学生之间的偏移,以及从该参考到强教师的家庭内对数似然变化。标准 OPD 将两个组件一起传输,允许偏移量主导更新方向并掩盖与教师能力改进相关的变化。我们提出 CompassOPD,它消除了这种抵消并转移了家庭内部的转变,而冻结的学生参考则锚定了学生初始政策的更新。因此,教师端和学生端的变化都是在各自的模型系列中测量的。在三个学生家庭和多个教师家庭中进行的实验表明,CompassOPD 的表现始终优于标准的跨家庭 OPD,将平均推理准确度提高了高达 5.50 分。对于 MoE 教师,我们通过减少专家激活,进一步直接从教师检查点构建参考,消除了对单独参考检查点的需要,同时保留了相对 OPD 3.43 点的增益。