论文
看看你说你在看的地方:视觉推理的自我关注
Look Where You Say You're Looking: Self-Grounded Attention for Visual Reasoning
摘要
我们引入了Self-Saliency,这是训练视觉语言模型 (VLM) 的一种方法,可以增加视觉注意力与推理中提到的图像区域之间的一致性。Self-Saliency使用视觉定位模型来定位每个推理步骤中提到的对象,并将结果区域视为模型视觉注意力的监督。先前关于引导视觉注意力的工作仅根据图像和问题来确定目标图像区域。相比之下,我们表明根据模型生成的推理调节目标区域可以提高下游性能。为了进行正确的评估,我们构建了一套统一的、广泛的 25 个视觉推理基准,在其中重现了以前方法的结果。我们发现Self-Saliency显着优于先前的注意力引导方法和基于图像级文本的基线,实现了更好的平均排名和更好的平均分数。 后训练分析表明,该模型主要使其推理文本适应现有的注意力模式,产生涉及更大区域的更短步骤。然而,当控制生成的文本时,对相关层中视觉定位区域的关注显着增加。最后,我们发现VLM视觉注意力对图像边界存在一致的几何偏差。然而,我们的消融表明,Self-Saliency的增益不能通过简单地将注意力与图像中心对齐来解释,强调了将视觉注意力与模型推理中提到的区域对齐的重要性。
