论文

人类和视觉语言模型之间的注意力协调

Attention Alignment Between Humans and Vision-Language Models

模型评测模型行为与机制分析

摘要

视觉感知取决于自上而下的目标和自下而上的感觉机制。视觉语言模型实现了这两者,使我们能够将每个组件视为一个可分离的假设,说明驱动我们观察的因素。我们将六种视觉语言模型的空间注意力图与在两项任务(一般描述和社交字幕)期间记录在 200 张图像上的人类注视热图进行了比较。这六个模型涵盖了 CNN 与 ViT 编码器与 LSTM 与 Transformer 解码器交叉的 2$\times$2 阶乘,以及 Molmo 7B-D 和 Qwen3.5 9B。我们发现解码器和编码器架构都形成了对齐,但解码器的选择占主导地位。 LSTM 与 Transformer 解码器相比,对齐提高了 40--50 个百分点(人类噪声上限的 80--87% 与 40--59%)。相比之下,CNN 与 ViT 编码器相比,根据解码器系列贡献了次要的 5--20 点优势,其中 CNN-LSTM 是总体最一致的模型 (85--87\%)。尽管具有对齐优势,LSTM 解码器注意力图在空间上是分散的,并且任务差异化程度最低。 ViT-Transformer,排列最弱,表现出最尖锐的空间集中和最强的任务分化。半空间忽略模拟证实,注意力消融对 LSTM 解码器的影响大于 Transformer 解码器。在使用 TRIBE 模拟的合成神经反应的探索性扩展中,注视对齐和神经相关性分离:CNN-Transformer 注意力图更好地预测了合成大脑活动,尽管注视对齐较低,注意图最能预测早期视觉皮层。自上而下和自下而上的组件一起权衡它们在行为和合成神经数据中的预测。