论文
将视觉语言模型的所见和感知与自适应信息流保持一致
Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow
摘要
视觉语言模型(VLM)在视觉识别、文档解析和视觉基础等广泛任务中表现出了强大的能力。然而,最近的研究表明,虽然 VLM 通常能够捕获与问题相对应的正确图像区域,但它们不一定会产生正确的答案。在这项工作中,我们证明这种错位可能是由于 VLM 内的信息流不理想所致,其中文本标记将过多的注意力分配给不相关的视觉标记,从而导致错误的答案。基于观察,我们表明在推理过程中调节信息流可以提高 VLM 的感知能力。这个想法是文本标记在解码过程中应该只与重要的视觉标记相关联,消除不相关区域的干扰。为了实现这一目标,我们提出了一种基于词元动态的方法来确定视觉词元的重要性,其中在不同解码阶段表现出不同激活模式的视觉词元被视为重要。我们将我们的方法应用于代表性的开源 VLM,并对各种数据集进行评估,包括视觉问答、视觉基础和计数、光学字符识别和物体幻觉。结果表明,我们的方法显着提高了基线的性能。项目页面:https://cxliu0.github.io/AIF/。