论文

ViT-Up:视觉忠实的特征上采样 Transformer

ViT-Up: Faithful Feature Upsampling for Vision Transformers

应用与实践视觉感知与空间理解

摘要

Vision Transformer (ViTs) 已成为视觉表示学习的主导架构,提供异常强大且可广泛重用的骨干功能。然而,由于全局自注意力的二次成本,ViT 通常在相对较小的 patch-token 网格上运行,这为语义分割和深度估计等密集预测任务造成了持续的瓶颈。这推动了与任务无关的特征上采样器的开发。虽然最近最先进的方法可以产生视觉上清晰的密集表示,但它们对浅层图像编码器进行引导上采样的依赖可能会导致特征泄漏、碎片和模糊。我们引入了 ViT-Up,一种隐式特征上采样框架,它用中间 ViT 隐藏状态的分层查询构造取代了外部图像引导。这使得能够在任意连续图像坐标处进行特征预测,同时保持与主干特征空间的对齐。实验表明,ViT-Up 在密集预测和语义对应方面始终优于最先进的图像引导上采样器。在 DINOv3-S+ 上,ViT-Up 在 Cityscapes 上比之前的方法提高了 +2.07 mIoU,在 SPair-71k 上提高了 +4.17 PCK@0.10。凭借更大的 DINOv3-B 主干网,这些增益增加到 +3.36 mIoU 和 +8.09 PCK@0.10,这表明 ViT-Up 可以随着主干网容量进行有利的扩展。