论文
OPD-V:具有模态平衡的视觉 同策略 自 蒸馏
OPD-V: Visual On-Policy Self-Distillation with Modality Balance
摘要
同策略 自蒸馏 (OPSD) 已成为一种标准 后训练 方法,用于改进多模态 大语言模型 (MLLM) 中的视觉推理。现有方法从不同的输入源提取特权信息来指导自我 蒸馏。然而,这些设计忽视了模态不平衡,这是 MLLM 推理固有的挑战。当文本信息主导生成时,模型无法完全集成其多模态输入。因此,精心设计的特权信息仍未得到充分利用,限制了 OPSD 的有效性。为了检查这一限制,我们构建了一个带有放大图像的正教师和一个带有掩模图像的负教师,它们表现出不同程度的模态不平衡。他们的推理正确性和词元 logits 的变化表明模态平衡本身可以充当特权信息。受这一发现的启发,我们引入了 OPD-V,这是一种视觉 OPSD 范式,它通过正教师和负教师实例化此类信息。正模态平衡 logits差值定义模态平衡信任区域,该信任区域选择用于自蒸馏 的 同策略 词元。跨 6 个基准、4 个 MLLM 主干和 5 个 后训练 方法的实验表明,OPD-V 持续提高推理性能,同时降低训练成本。