论文
越晚越好:分布偏移下 ViT 的词元削减
Later Is Better: Token Reduction for ViTs Under Distribution Shift
摘要
无需训练 token 减少通过跨层删除冗余的 token 来加速视觉变换器,以一小部分计算恢复大部分原始精度。然而,这些方法主要是在干净的数据上设计和评估的,并且在现实世界的分布下,它们与未压缩模型的精度差距随着去除率的增加而扩大。我们表明,这种差距是由减少时间表、去除深度剖面决定的,通常作为实施细节固定下来。具体来说,我们引入了一种 one-参数后期集中幂律计划,该计划能够持续提高分布外的准确性,而无需额外的推理成本。在带有 DeiT-S 的 ImageNet-C 上,较晚的计划以 26% 的计算减少 (+1.17pp) 弥补了 83% 的差距,并以 7% 的较轻减少 (+0.26pp) 弥补了 99% 的差距。增益不能归因于保留更多的 token 或使用额外的计算:保持平的计算,较晚的计划总共删除了更多的 token 并在最后留下更少的 token,但仍然获胜。单层 探针 指出了一种机制:早期的减少扰乱了通过更多剩余层的特征,在深度上提前加载减少误差。效果是广泛的,涵盖五种 token 缩减方法(ToMe、EViT、ATS、ATC、PiToMe)、九种 骨干模型、所有 ImageNet-C 损坏类型、八种进一步的转变套件以及两种进一步的模式(视频和视觉语言 QA)。它也特定于转变,在干净时仍然为正,并且单调上升到最高严重性 5 时的约 4 倍。该时间表在六种测试时适应方法下保持其增益,并且不需要每个输入或每个域调整。
