论文
带有吵闹学生的自增强视觉语言模型 同策略 Self-蒸馏
Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation
摘要
后训练 使视觉语言模型 (VLM) 能够理解人类指令并执行各种下游任务。当前的 后训练 方法通常依赖于人工注释的数据、来自外部模型的 蒸馏、带有人类反馈的强化学习或可验证的答案。这限制了他们在没有外部监督的情况下改进的能力。为了解决这个问题,我们提出了 NOPD(Noisy Student 同策略 Self-蒸馏),这是一种简单而有效的 self-蒸馏 方法,无需任何外部模型或 真值 答案即可改进 VLM。我们的主要见解是,干净输入和损坏输入之间的预测差异自然会产生自我监督信号。在 NOPD 中,模型从损坏的输入中学习,同时在干净的输入下使用自己的预测作为 词元级 监督。我们展示了 NOPD 在五项视觉推理任务上的有效性;它可以匹配甚至超越来自外部模型的强化学习方法或 蒸馏。值得注意的是,当使用 Geometry3K 的 2.1K 样本进行训练时,NOPD 在其验证集上将 Qwen2.5-VL-7B 提高了 20 个点。它还显示了分布外测试集的泛化能力,并在 MathVista 上获得了 7.4 分的提升。此外,我们证明 NOPD 是增强 VLM 的通用方法,在 12 个基准上实现了三个模型的改进。