论文

视觉 Transformer 从自然图像中学习格式塔式的图形背景线索

Vision Transformers Learn Gestalt-Like Figure-Ground Cues from Natural Images

模型评测模型行为与机制分析

摘要

人类视觉系统中的图形-背景组织依赖于几种基于形状的线索,包括包围度、凸度和对称性。虽然这些线索已经使用抽象刺激进行了广泛的研究,但人们对它们在自然条件下如何运作或它们如何从自然场景的统计数据中产生的了解甚少。深度神经网络提供了一条充满希望的前进道路:一个依赖于与人类相同的图形背景线索的模型将为底层机制提供易于处理的实验访问。在本研究中,我们评估了 Vision Transformer (ViTs) 中基于形状的图形背景组织,之前的工作已经证明了基于对象的分组的出现。我们测试了涵盖监督和自监督训练目标的 25 个 ViT,通过拟合线性探针来使用自然图像和隔离个体线索的受控人工刺激来预测中间补丁表示的图形-背景分配。我们的结果表明,ViT 可以稳健地编码包围度和凸度,并且在自然图像上训练的探针可以将零样本推广到多个模型中的人工刺激。对于对称性,我们观察到混合结果:提示被编码为均匀颜色,但不是纹理区域。总而言之,我们的研究结果表明,可以从自然场景统计中学习类似格式塔的图形背景线索,并将 ViT 定位为研究感知组织计算机制的引人注目的模型系统。代码和数据可在 https://github.com/mtangemann/mlvbench 获取