论文

通过反事实语义显着性揭示人类和 VLM 场景感知的差距

Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency

模型评测评测方法与指标

摘要

评估大型视觉语言模型 (VLM) 是否符合人类感知以实现高级语义场景理解仍然是一个挑战。传统的白盒可解释性方法不适用于闭源架构,并且被动指标无法隔离因果特征。我们引入反事实语义显着性(CSS)。这种与模型无关的黑盒框架通过测量场景中对象的因果消融引起的语义转移来量化对象的重要性。为了评估人工智能与人类的语义一致性,我们根据人类心理物理学基线测试了重要的 VLM,该基线包括 307 个复杂自然场景中的 16,289 个有效响应和 1,306 个高保真反事实变体。我们的分析揭示了普遍存在的场景理解差距:模型表现出对大型物体(尺寸偏差)、图像中心物体(中心偏差)和高显着性物体的过度依赖(相对于人类)。相比之下,模型对场景中的人的依赖程度低于人类参与者来描述图像。模型的大小偏差是解释模型与人类语义分歧变化的主要驱动因素。代码和数据可在 https://github.com/starsky77/Counterfactual-Semantic-Saliency 获取。