论文

Uni-OPD:将 同策略 蒸馏 与双视角配方统一起来

Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe

摘要

同策略 蒸馏 (OPD) 最近作为一种有效的 后训练 范例出现,用于将专业专家模型的功能整合到单个学生模型中。尽管在实证上取得了成功,但 OPD 产生可靠改善的条件仍然知之甚少。在这项工作中,我们确定了限制有效 OPD 的两个基本瓶颈:对信息状态的探索不足以及教师对学生采样轨迹的监督不可靠。基于这一见解,我们提出了 Uni-OPD,这是一个统一的 OPD 框架,可泛化 大语言模型 (LLM) 和多模态 大语言模型 (MLLM),以双视角优化策略为中心。具体来说,从学生的角度来看,我们采用两种数据平衡策略来促进训练期间对学生生成的信息状态的探索。从教师的角度来看,我们表明可靠的监督取决于聚合的 词元级 指导是否与结果奖励保持顺序一致。为此,我们开发了一种以结果为导向的余量校准机制,以恢复正确和错误轨迹之间的顺序一致性。我们对 5 个领域和 16 个基准进行了广泛的实验,涵盖不同的设置,包括跨 LLM 和 MLLM 的单教师和多教师 蒸馏、从强到弱的 蒸馏 以及跨模式 蒸馏。我们的结果验证了 Uni-OPD 的有效性和多功能性,并为可靠的 OPD 提供了实用的见解。