论文
激光:通过视觉注意力保护和下沉抑制实现 LVLM 的矫正镜片
LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression
摘要
大型视觉语言模型(LVLM)表现出强大的推理能力,但在长视野解码过程中会出现视觉遗忘,注意力逐渐从视觉证据上转移。现有的方法主要将此问题视为后期注意力衰减问题,或尝试通过启发式提醒或事后注意力提升来缓解它。通过系统的实证分析,我们发现视觉遗忘下的性能下降很大程度上是由两个被忽视的因素驱动的:早期注意力衰退破坏了证据获取,以及注意力集中在与任务无关的视觉接收标记的子集上。受这些见解的启发,我们提出了 LASER,这是一个 后训练 框架,它可以在推理过程中调节视觉注意力轨迹和视觉内标记注意力分布。从技术上讲,LASER 引入了两种互补的奖励:视觉视觉证据依赖奖励(Visual Grounding Reward),它鼓励模型在整个解码过程中保持对语义上显着的视觉标记的关注;以及注意力汇聚抑制奖励(Sink Suppression Reward),它惩罚对视觉注意力汇聚点标记的过度注意力集中。总之,这些奖励可以保持早期阶段对视觉证据的依赖,同时防止注意力集中到无信息的区域。对八个基准数据集的广泛实验表明,LASER 始终优于强基线,验证了注意力意识训练是视觉遗忘的有效补救措施。