论文
能力 $\neq$ 可解释性:视觉基础模型的人类可解释性
Capability $\neq$ Interpretability: Human Interpretability of Vision Foundation Models
摘要
领先视觉模型的特征的可解释性如何?随着这些模型从研究基准转向高风险部署,这个问题变得越来越紧迫,但现有方法无法可靠地回答这个问题。我们通过测量和比较人类对视觉模型的可解释性的框架来缩小这一差距,该框架围绕两个互补的心理物理学协议构建:(1)可定位性——观察者能否预测新图像上的特征在哪里触发? ——以及(2)可命名性——观察者能否准确地描述该特征所代表的内容?通过稀疏自动编码器恢复特征,并且机会锚定评分函数将每个模型置于公共尺度上。将该框架应用于六个视觉 Transformer——两个受监督的 ViT 和四个基础模型(DINOv2、DINOv3、CLIP、SigLIP)——我们收集了超过 15{,}000$ 的行为响应,分析了通过我们预先指定的质量检查的 377$ 美元参与者的 13{,}400$ 响应。基础模型始终比受监督模型的可解释性“较差”,并且这种差距不是能力权衡:可解释性与我们检查的任何基准上的下游任务绩效都没有关联。真正相关的是特征激活的局部性和与人类的粗粒度语义对齐——具有焦点激活和反映世界广泛分类结构的表示的模型产生更多可解释的特征,而细粒度感知对齐则不然。这两个协议产生强相关的排名并共享相同的预测变量,将可解释性建立为表示质量的独立、可测量的维度——而且令人惊讶的是,我们测试的每个基础模型都低于之前的监督基线。仅靠能力无法弥补这一差距;局部性和粗粒度对齐都可以。