论文
视觉语言模型中的视觉注意力 忠实性 是异构的
Visual Attention Faithfulness in Vision-Language Models is Heterogeneous
摘要
注意力权重是否忠实地反映模型推理一直是 NLP 领域争论的焦点,但对于视觉语言模型 (VLM) 中的视觉模态来说,这个问题在很大程度上仍未得到探索。我们通过对当前 VLM 进行因果扰动分析来解决这一差距,评估注意力排名视觉标记的全面性和充分性差距。我们的分析表明,视觉注意力 忠实性 是异构的,表现为三种不同的处理模式:忠实-足够,其中 top-$k$ 注意力标记对于预测来说既是必要的又是充分的;忠实分布,有必要但仍需要更广泛的视觉背景;非焦点,其中局部注意力区域不是单独必要的,而视觉信息仍然是预测的重要触发因素。此外,与模型注意力排名相比,人工注释的 真值 区域仅在 $\sim 60$% 的情况下满足综合性,揭示了模型视觉依赖和人类直觉之间的系统差异。我们在 VQAv2 上的一般 VQA 以及 VRDU 和 ChartQA 上的文档任务中演示了这些模式,表明视觉注意力 忠实性 随着处理需求和模型架构的不同而系统地变化,而不是一致地忠实或不忠实。