论文
LEGO-OPD:用于多模态同on-policy蒸馏的分解教师组合
LEGO-OPD: Factorized Teacher Composition for Multimodal On-Policy Distillation
摘要
多模态同策略蒸馏(OPD)旨在提高视觉基础,同时保留语言模型强大的推理能力。最近的多教师方法将 LLM 和 VLM 教师结合起来,提供补充监督。然而,直接使用VLM的完整预测分布会使其视觉基础信号与其自己的语言先验纠缠在一起,从而阻止了基础信息的独立传输。相反,增加视觉监督的强度可以改善感知,但可能会过分强调视觉证据并降低语言推理能力。为了解决这种权衡问题,我们引入了 LEGO-OPD,它选择性地将语言专家和基础专家中的因素组合成多模态 OPD 的一个教师分布。根据广义贝叶斯公式,语言专家提供候选标记的先验,而基础专家提供更新此先验的视觉可能性,而不是转移其完整的预测分布。这种分解的组合允许独立控制语言推理和视觉基础。我们进一步引入自适应校准来确定视觉可能性应在每个解码前缀处更新语言的强度。具体来说,LEGO-OPD 使用grounding专家的图像引起的预测偏移作为依赖于前缀的参考,从而防止视觉监督不足和过度。 Qwen3 模型的实验表明,LEGO-OPD 在多模态和纯文本推理任务上始终优于评估的单教师和多教师 OPD 基线。此外,它提高了最初学生的视觉感知,同时保留了纯文本推理。