论文

更准确,更少人性化:视觉模型中的格式塔分组

More Accurate, Less Human: Gestalt Grouping in Vision Models

模型评测基准与评测资源

摘要

人类视觉将所看到的事物组织成整体:相同颜色的点组合成系列,相似的标记组合成类别,形状组合成可识别的物体。这些是可视化设计所建立的格式塔操作。视觉模型是否以这种方式组织视觉内容尚未经过系统测试。我们引入了一种行为电池,可以根据先前感知研究中的人类数据对四个分组任务的模型进行评分:标记颜色奇数、颜色系列计数、轮廓识别和物体奇数。我们将其应用于 5 个训练系列的 45 个模型:监督、自监督和对比视觉语言编码器、开放权重 VLM 和封闭基础模型。电池显示,与人类反应的一致性捕获了传统性能指标无法区分的感知组织的各个方面,几个封闭模型的一致性远远低于其基准准确性所建议的一致性。因此,根据已发布的感知数据进行评分为可视化研究提供了一个可重复使用的标准,无需新的用户研究,即可审核现在进入可视化管道的模型是否按照人类观众的方式组织他们所看到的内容。