论文

UP-MOPD:在真实参数更新中处理多教师冲突

UP-MOPD: Update Projection in Multi-Teacher On-Policy Distillation

摘要

来自多个教师的 同策略蒸馏将来自不同领域的专业知识整合到一个 学生模型 中,但相互冲突的梯度可能会阻碍这种集成。 梯度修正直接约束普通 SGD 下的参数更新。然而,使用 AdamW 等优化器,动量、自适应缩放和权重衰减可以将校正后的梯度转变为将域损失增加到一阶的更新。为了解决这一差距,我们提出了 Multi-教师模型 同策略蒸馏的更新投影 (UP-MOPD)。 UP-MOPD 让原始混合梯度更新优化器状态并生成候选位移,然后仅在将违规候选者提交到参数之前对其进行投影。该投影给出了欧几里得距离中最接近候选者的唯一可行更新。在结合医学和一般领域的实验中,UP-MOPD 在训练后期的 IFEval-loose 精度比普通 M-OPD 提高了 2.96 个点。它在八个指标上的平均得分为 60.03,而梯度投影的平均得分为 59.00,更新拒绝的平均得分为 59.15。在涵盖数学、代码和指令遵循的公共基准测试中,它在六项任务中取得了最佳平均值 (32.67),在 LiveCodeBench v5 上领先,并与最佳 IFEval 结果并列。这些结果支持预测优化器更新以减少域之间的干扰。