论文

UniRefiner:教导预先训练的 ViT 通过对比寄存器自行处理渣滓

UniRefiner: Teaching Pre-trained ViTs to Self-Dispose Dross via Contrastive Register

模型架构Transformer

摘要

Vision Transformer (ViTs) 的表示学习发展迅速,但大型模型在空间敏感任务中的实用性受到虚假标记的阻碍。之前缓解这一问题的努力是有限的,通常将这些伪影定义得很狭隘,例如,简单的高范数异常值。我们认为这个范围是不够的。对于密集的预测任务,我们认为任何未能编码位置对齐语义的标记都应被视为虚假工件。这个更广泛的定义揭示了一个更复杂的问题,使我们能够系统地对破坏空间表示的三种基本类型的虚假标记进行分类和表征。基于这种全面的诊断,我们提出了 UniRefiner,这是一个通用的细化框架,可以教会预先训练的 ViT 自我处理这些工件。 UniRefiner 使用对比寄存器通过双重目标显式隔离和重新分配虚假标记:(i) 将图像标记与过滤后的常规标记对齐以保留语义,(ii) 将寄存器标记与检测到的虚假标记对齐以捕获虚假信号。我们的方法只需要在约 5k 图像上进行几个 微调 epoch 即可细化各种 ViT,包括 EVA-CLIP-8B 和 InternViT-6B 等大规模模型。实验证明了一致且显着的改进:值得注意的是,改进后的 EVA-CLIP-8B 在 ADE20K 上实现了 51.9\% mIoU (+9.4\%),超越了 DINOv2 (49.1\%) 等专业视觉模型,而零样本分割精度提高了高达 22\%。 UniRefiner 释放了现有大型基础模型的潜在空间潜力,为其更广泛的应用铺平了道路。