论文
MLLM 真的看见了吗:强化多模态 LLM 中的视觉注意力
Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs
摘要
尽管思维链(CoT)推理已显著提升多模态大语言模型(MLLM)在复杂推理任务上的表现,现有方法大多依赖冗长的文本推理轨迹,且为学习稳定的视觉注意力策略提供的机制有限。我们的分析表明,当前 MLLM 表现出较弱的视觉聚焦:早期阶段的视觉错位在后续推理中很少得到纠正,导致误差传播和推理失败。我们认为这一局限源于训练中对视觉注意力的贡献归因不足。为解决该问题,我们提出 SAYO,一个以强化学习(RL)框架训练的视觉推理模型,引入基于区域级视觉注意力的奖励。该奖励将优化信号显式地对齐到有视觉依据的推理步骤,使模型能够学习更可靠的注意力行为。在多个多模态基准上的大量实验表明,SAYO 在多样的推理与感知任务上持续提升性能。
