论文
视觉编码器是否具有类似人类的颜色阈值?
Do Vision Encoders Exhibit Human-like Color Thresholds?
摘要
理解和表征人类颜色感知是一个长期的研究目标。最传统的方法之一是寻找人类颜色辨别阈值,即人类观察者可感知的最小色差。近年来,深度神经网络已成为计算机视觉任务的标准网络。特别是深度视觉编码器,即在大规模视觉数据上训练的基础模型,将图像映射到潜在特征表示。尽管深度视觉编码器被广泛使用,但很少有研究调查其内部表征是否表现出类似人类的辨别阈值。在这项工作中,我们提出了一项大规模探索性研究,探讨了 50 多个预训练视觉编码器(包括卷积网络和视觉 Transformer)针对人类辨别阈值的色敏度。使用多个色度级别的受控色度刺激,我们通过区域重叠度量(mIoU)将模型导出的色度辨别阈值与人类辨别椭圆进行比较。我们的分析表明,所有模型系列的模型表示和人类感知阈值之间的一致性普遍较弱,最佳 mIoU < 0.25。此外,我们发现自监督编码器的性能始终优于监督编码器,而语言监督模型表现出最两极分化的行为,占据排名的顶部和底部。这些发现表明,对于任何分析的架构,当前的大规模视觉训练目标都不会自然地出现类似人类的色敏感性。