论文

学习视觉 Transformer 探测的动态证据路线

Learning Dynamic Evidence Routes for Vision Transformer Probing

模型评测模型行为与机制分析

摘要

探测冻结视觉 Transformer 通常使用排列不变聚合(GAP 或 $\texttt{[CLS]}$),将补丁标记视为非结构化集合。诸如自注意力之类的内容相关探针是有用的准确性控制,但它们不会公开用于审计的固定词元时间表或固定位置权重。我们引入了$\textbf{SSMProbe}$,这是一种显式可检查的探针,它用 Sinkhorn 学习的证据路径和对角线 S4 解码器取代了不变池化。 S4 解码器是一个线性时不变 (LTI) 系统,其最终状态具有固定的位置相关系数,因此探针引起的路由序列可以作为具体对象进行审核,而不是仅根据准确性进行推断。我们的中心测量是路由证据的几何形状:通过此诊断将哪些补丁标记移动到有影响的位置,这些标记是否形成空间组织的区域或类似随机的分散集,以及固定的 S4 内核如何对它们进行加权。在 MAE、BEiT、DINOv2 和有监督的 ViT 中,这种路线几何结构将 MAE 分散的、近乎随机的路线与 BEiT、ViT 和 DINOv2 的空间组织性更强的路线分开,而 DINOv2 保留了独特的强大 $\texttt{[CLS]}$ 轮廓。 SSMProbe 使用状态空间模型的数学透明度将冻结的 ViT 读数转变为可审计的证据路由分析。