论文

RP-OPSD:分辨率优先 同策略 用于多模式 大语言模型 的自 蒸馏

RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models

摘要

同策略 Self-蒸馏 (OPSD) 使用仅教师可用的特权信息,对学生生成的轨迹提供密集的 词元级 监督。然而,现有方法通常依赖于经过验证的解决方案轨迹、外部模型生成的解释或手动本地化的视觉证据,这限制了它们在多模态 大语言模型 上的可扩展应用。为了解决这个问题,我们利用同一图像的高分辨率和低分辨率视图之间的信息差距,并提出 RP-OPSD(用于多模态 大语言模型 的分辨率特权 同策略 Self-蒸馏)。在训练期间,学生策略根据原始分辨率四分之一的图像生成 同策略 轨迹,而教师策略使用原始分辨率图像提供监督。通过最小化沿学生轨迹的输出分布之间的差异,学生可以学习教师在高分辨率输入下的预测行为,从而增强其低分辨率能力,并将学到的改进转化为原始分辨率推理。 RP-OPSD 既不需要额外的人工注释,也不需要外部模型来生成解决方案轨迹,而只需要图像-问题对。在 Qwen3.5-9B 上的实验表明,RP-OPSD 在原始分辨率下的平均性能相对提高了 5.45\%,训练加速比 OPSD 提高了 1.78\times$。这些结果表明,分辨率差异可以作为特权信息的简单且可扩展的来源,为多模式 大语言模型 的 同策略 自 蒸馏 提供有效且高效的方法。