论文
ProgResViT:自适应视觉的渐进分辨率和宽度 Transformer
ProgResViT: Progressive Resolution and Width for Adaptive Vision Transformers
摘要
Vision Transformer (ViTs) 通常使用固定的输入分辨率和模型宽度处理每个图像,尽管许多图像可以通过少得多的计算进行分类。我们引入了 ProgResViT,这是一种输入自适应 ViT,可以在多轮中逐步执行推理。第一轮处理具有狭窄子网的低分辨率图像。当预测足够可信时,推理终止;否则,模型将重用当前轮中生成的表示,并继续使用更高分辨率的输入和更广泛的子网络来完善其预测。由于所有轮次共享一个主干网,我们提出了进度条件软门控(PSG),它根据当前轮次、块和输入分辨率来调节词元融合和层输出。在图像分类方面,将 ProgResViT 应用于 DeiT 可以比自适应宽度、自适应深度和动态词元基线产生更好的精度计算权衡。借助 知识蒸馏,基于 DeiT 的 ProgResViT 实现了 84.9% 的 top-1 准确度,略高于在可比评估设置下报告的 DeiT-III-S 准确度。我们表明,相同的设计还为自监督 DINO 表示和下游语义分割提供了有利的精度计算权衡。代码可在 https://github.com/ds-kiel/ProgResViT 获取。