论文

超越颜色几何:评估视觉模型中的类人颜色表示

Beyond Color Geometry: Evaluating Human-Like Color Representations in Vision Models

模型评测模型行为与机制分析

摘要

视觉模型能像人类一样看到颜色吗?现有的颜色表示评估通常将其与 CIELAB 等几何空间或离散颜色标签进行比较。这些参考捕获了感知距离或类别成员资格,但没有捕获人们组织颜色的分级方式。我们根据模糊感知模型评估色彩底色,该模型具有适合人类调查数据的 86 个分级类别。该框架可应用于任何图像编码器,并测量三个互补的属性:类别边界、类别紧凑性和超出颜色几何本身所能解释的分级对齐。在 11 个 Vision Transformer 编码器中,类别级结果大致相似,而分级对齐却有很大差异。掩码自动编码器实现了最强的超越几何对齐,其置信区间与其他编码器的置信区间不重叠。逐层分析进一步表明,掩模重建保留了输出的这种结构。在自然图像上,MAE 全局表示表面颜色,而语言监督模型则对与前景对象相关的颜色进行更强的编码。这些结果表明,类人色底有几个不同的方面,不应简化为单一分数。