论文

位置编码锚定视觉中的空间结构 Transformer:鲁棒性的几何视角

Positional Encodings Anchor Spatial Structure in Vision Transformers: A Geometric Perspective on Robustness

模型评测模型行为与机制分析

摘要

众所周知,Vision Transformer (ViT) 中的位置嵌入 (PE) 会影响性能和鲁棒性,但它们在塑造内部空间表示方面的作用尚不清楚。在这项工作中,我们研究了不同形式的 PE 如何影响 ViT 的表征几何,以及这些变化如何与内容破坏性分布变化下的鲁棒性相关。我们引入了一种度量,即空间相似距离相关性(SSDC),来量化词元表示中的空间结构。使用这个指标,我们表明,在没有 PE 的情况下训练的 ViT 仍然会发展出不平凡的空间结构,但这种结构是由视觉内容驱动的,并在词元排列下崩溃。相比之下,我们发现所有考虑的 PE(学习的绝对、正弦和旋转)都与向索引锚定空间组织的一致转变相关。这些模型中的表示在破坏内容的扰动下保持稳定,并且对这种分布变化表现出显着提高的鲁棒性。我们进一步表明,虽然不同的 PE 产生不同的空间结构深度轨迹,但它们的鲁棒性属性在很大程度上相似(编码方案之间存在二次变化),这表明鲁棒性似乎更多地依赖于稳定位置参考帧的存在,而不是依赖于特定的编码机制。这些结果提供了位置编码如何塑造内部表示的几何解释,对未来编码方案的原则设计具有影响。