论文

SAGE:视觉语言解码器中视觉接地的接收器感知引导重点

SAGE: Sink-Aware Guided Emphasis for Visual Grounding in Vision-Language Decoders

模型推理模型评测解码与生成控制模型行为与机制分析

摘要

最近的大型视觉语言模型(VLM)将视觉编码器与大型语言模型(LLM)配对,并在各种图像文本任务上表现良好,但它们的可靠性通常受到解码器注意病理的限制,这些病理会抑制视觉证据并加剧幻觉。在本文中,我们重新审视视觉注意力池并揭示了一种结构化的、依赖于层的行为:在提示中,早期和晚期解码器层在相同的几个图像区域上表现出提示不变的注意力崩溃,我们称之为PIS(提示不变池),而中间层则成为提示条件的并驱动视觉语言对齐。这种分歧表明,将水槽视为统一效果是不完整的。基于这一见解,我们提出了 SAGE(Sink-Aware Guided Emphasis),这是一种轻量级干预措施,可使用源自标准视觉主干(例如 CLIP、ViT 和 DINOv3)的标记对齐 ROI 掩模,将解码器的注意力从 PIS 转移到查询相关的感兴趣区域 (ROI)。在不同的视觉编码器 + 仅解码器 LLM VLM 系列上进行评估,SAGE 改善了视觉效果 接地,减少幻觉,并在公共下游视觉语言基准中产生一致的收益,包括细粒度的视觉歧视设置,当使用骨干衍生的 ROI 掩模实例化时,本地化证据至关重要。