论文

用于迭代图像大小不可知视觉的自监督预训练 Transformer

Self-supervised pretraining for an iterative image size agnostic vision transformer

模型训练预训练

摘要

愿景 Transformer (ViTs) 主导自我监督学习 (SSL)。虽然它们已被证明对于大规模预训练非常有效,但它们的计算效率低下,并且随图像大小的扩展性很差。因此,像 DINO 这样的基础模型仅限于低分辨率处理。最近受中央凹启发的 Transformer 通过迭代处理多缩放补丁的固定大小上下文来实现分辨率不可知论。该模型通过监督学习展示了有希望的结果,利用了连续的、类似循环的过程,而无需随时间反向传播。为了释放其作为基础骨干网的潜力,我们引入了一种基于 DINO 自我 蒸馏 目标的新型顺序到全局 SSL 框架。在高效的积分图像块提取方法的支持下,我们的方法可以对图像大小无关的视觉编码器进行大规模预训练。我们在 ImageNet-1K 和下游分类任务上实现了具有竞争力的性能,无论输入分辨率如何,都保持恒定的计算预算。