论文

主动空间引导:消除视觉中注入的位置机制 Transformer

Active Spatial Guidance: Eliminating Injected Positional Mechanisms in Vision Transformers

模型架构Transformer

摘要

Vision Transformer (ViTs) 通常依赖注入的位置机制来解决自注意力的排列不变性。受自然图像的空间规律的启发,我们询问空间组织是否可以从数据中归纳出来,而不是明确地注入。在受控、匹配的从头开始训练下,我们提出了主动空间指导(Guidance),这是一种仅训练的目标,它禁用位置注入并对最终层补丁标记应用辅助 2D 坐标回归损失。引导头仅在训练期间使用,并在推理时移除;部署的模型由无位置注入的 ViT 编码器和特定于任务的预测模块组成。使用 DINOv3 ViT 主干,Guidance 持续提高 ImageNet-100 分类、ADE20K 语义分割和 Hypersim 单目深度估计的性能,优于强注入基线,例如在相同训练协议下学习的绝对位置嵌入和旋转位置嵌入。在 ImageNet-100 上,与代表性注入位置设计的更广泛比较进一步支持了 Guidance 的有效性。指导还提高了分辨率传输下的鲁棒性,多分辨率训练进一步增强了输入大小的准确性。总的来说,我们的结果表明,ViT 中的空间归纳偏差不需要在架构上注入,而是可以通过训练时监督来塑造。用于训练和评估的代码可在 https://github.com/cloudlc/asg 中公开获取。