论文

视觉模型通过有限的神经对齐来预测城市场景评估

Vision Models Predict Urban Scene Appraisal with Limited Neural Alignment

模型评测模型行为与机制分析

摘要

预训练的视觉嵌入越来越多地用作通用表示,用于对人们如何评价城市场景进行建模,并且几乎完全通过它们预测人类评分的程度来验证。高预测准确性并不能证明这些嵌入可以像人类感知那样组织场景。我们根据大脑数据分别测试这两个属性。使用 63 名观看并评价 56 个柏林街景的成年人公开发布的脑电图,我们估计了随着时间的推移场景的表征几何、可解释的几何的比例,以及它与涵盖语言监督、自我监督、类别监督和密集预测训练、两个数量级的尺度和可解释控制的 17 个特征空间的对应关系。一致性很低:最佳表示 DINOv2 ViT-B 达到噪声上限下限的 29.6%,面板跨度为 11.0% 到 29.6%,Gabor 能量描述符与最佳模型无法区分,同时优于所有测试的语言监督模型。在模型中,更深的层仍然与后来的神经响应相匹配,因此即使在如此低的总体水平上,为对象识别找到的分层对应关系仍然存在。相同的嵌入可以很好地预测保留的评估评级,最高可达 r = 0.87,并且这两种度量不会在模型中相互跟踪;针对神经几何重新加权特征会降低每个测试模型的评估预测,而不是匹配维度的控制。因此,预测如何评估街道并不足以证明模型可以像大脑一样代表街道。该基准仅使用公共数据,不需要训练,因此评估新的表示只需要 55 个图像的嵌入。