论文
通过子空间干预理解自监督视觉 Transformer 中的几何表示
Understanding Geometric Representations in Self-Supervised Vision Transformers via Subspace Intervention
摘要
我们引入了受控子空间干预框架来研究自监督视觉 Transformer (ViTs) 如何编码密集的几何信息。虽然线性探测广泛用于评估几何表示,但它将特征视为黑匣子,无法理清底层拓扑。为了解决这个问题,我们使用奇异值分解(SVD)分解收敛线性探针的权重,以隔离包含显式几何信号的低秩子空间。我们的观点产生了三个关键见解:(1)预训练 目标决定了特征的编码方式。 DINOv2 对齐空间特征以实现高效的线性提取,而掩码自动编码器 (MAE) 倾向于分散这些信号,需要更广泛的空间上下文。 (2) 显式几何表示具有高度可压缩性,这表明密集的预测头可能会被限制在低秩子空间中,而性能损失最小。 (3) 逐层任务亲和力表明,几何精度在最终层中屈服于语义抽象之前在中间层达到峰值。通过将内部编码机制与下游性能联系起来,这些发现为有效的特征选择和轻量级解码器设计提供了基础。源代码可在 https://github.com/Zhou-Weichen/Geosubprobe 获取。