论文

从边缘到深度:探索视觉中的空间层次 Transformer

From Edges to Depth: Probing the Spatial Hierarchy in Vision Transformers

模型评测模型行为与机制分析

摘要

仅接受图像分类训练的 Vision Transformer 通常会转移到需要空间理解的任务,但它们在预训练期间没有接受空间监督。我们询问这样的结构在哪里编码以及编码的稳健程度如何。逐层探测冻结的 ViT-B/16 的两个互补属性,即局部补丁边界 (BSDS500) 和每个补丁深度 (NYU Depth V2),揭示了一个清晰的层次结构:边界结构在第 5-6 层变得可线性解码 (AP = 0.833),而需要集成全局线索的深度在第 8 层稍后达到两到三层峰值 (MAE = 0.0875)。两个信号都在最终分类层崩溃,随机权重控制确认编码是学习的而不是架构的。因果干预增加了特异性:消除线性深度探针读取的单一方向会使深度解码性能降低高达 165%,而消除任何其他方向只会导致深度解码性能下降不到 1%。沿着该方向的有针对性的激活修补表明,深度信号在每一层都部分地重新导出,而不是被动地携带在残余流中,中间层干预在下游持续最强烈。结果是,经过分类训练的 ViT 开发出一个积极维护的空间层次结构,反映了在灵长类动物视觉皮层中观察到的早期到晚期的进展。