论文
用注意力显著图解释视觉语言模型的图表理解
Attention-Guided Saliency Maps for Interpreting Visualization Literacy in VLMs
摘要
理解视觉语言模型如何解读数据可视化仍是开放问题,随着其用于需要可靠推理的分析任务,这一点更加重要。论文提出面向 Transformer 图像条件文本生成的轻量诊断显著图方法,聚合语言模型所有层与注意力头对视觉词元的关注,再映射回视觉编码器的图像块网格,建立每个生成回答词元与其关注图像区域的直接对应。由此得到无需梯度的快速显著图,展示模型在回答过程中如何分配对视觉元素的注意力,并检查关注区域是否与语义相关内容一致。研究以删除指标评估显著图对模型行为的因果忠实性。