论文

提高自进化多模态模型对视觉词元的注意力

Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models

模型训练强化学习

摘要

最近,自进化大型多模态模型(LMM)因在纯无监督环境中改善视觉推理而受到关注。然而,现有的自进化 LMM 中的多角色自我对弈和自一致性奖励方案优化了答案一致性,但没有确保解码器关注视觉内容,而是依赖统计语言先验来产生自一致性输出。这导致了我们称之为视觉条件不足的持续失败模式,其中解码器在生成过程中依赖于语言先验而不是图像,表现为对视觉标记的关注不足。因此,当前的自我进化 LMM 在视觉语言理解任务(例如图像字幕和视觉问题回答)上遇到了困难。为了解决这个问题,我们提出了VISE(视觉不变性自我进化),这是一个纯粹的无监督自我进化框架,它通过两个互补的基于不变性的奖励直接规范模型的视觉调节策略:几何不变性奖励在已知变换下强制空间一致性,语义不变性奖励通过要求模型在预测区域受到干扰时识别证据的缺失来惩罚证据不可知的生成。 VISE 在单一模型中运行,无需专家角色、外部奖励模型或注释,并在原始未标记图像上进行训练。 18 个基准测试的实验证明了我们方法的有效性。使用 Qwen3-VL-2B 作为基础模型,VISE 在 COCO 上获得了 $+1​​6.85$ CIDEr 的收益,在 TextCaps 上获得了 $+1​​9.66$ CIDEr 的收益,将物体幻觉减少了 $5.0$ Chair-I 点,并推广到四个模型系列和规模。我们的代码和模型可在 https://mbzuai-oryx.github.io/VISE 获取