论文

相似的选择,不同的注意力:人类和视觉语言模型中的跨模态关联

Similar Choices, Different Attention: Cross-Modal Associations in Humans and Vision-Language Models

模型评测模型行为与机制分析

摘要

跨模态关联是跨模态特征的系统配对,例如“bouba”与圆形的关联以及“kiki”与尖锐形状的关联。先前的工作已经在此类关联上比较了人类和视觉语言模型(VLM),但通常在人类和模型之间使用不同的刺激或任务。在这里,我们要问的是,VLM 是否不仅在选择上与人类一致,而且在做出这些选择时的看法上也与人类一致。我们研究了 VLM 和人类 (N = 53),向他们提供相同的刺激、一个伪词和两张图像,并记录参与者的选择和眼球运动,然后将其发布。我们在一些较大的 VLM 中发现了选择对齐,但它们的显着性与人类凝视的匹配程度不如中心偏差基线(每个图像中心的固定高斯分布)。对人类选择进行微调的小型 VLM 可以使它们的选择一致性达到人类对未见过的单词和图像的多数投票参考的水平,但它们的注意力仍然与人类凝视的匹配程度低于该基线。训练模型对人类凝视的注意力会提高注意力-凝视相关性,但不会改善选择对齐,并且每个图像位置的单个平均凝视图也会将其提高类似的量。因此,匹配人类的选择,甚至人类的注视模式,并不足以证明人类对齐的跨模式处理。