论文

ARTA:用于高效密集特征提取的自适应混合分辨率词元分配

ARTA: Adaptive Mixed-Resolution Token Allocation for Efficient Dense Feature Extraction

模型架构Transformer

摘要

我们提出了 ARTA,一种混合​​分辨率从粗到细的视觉 Transformer,用于高效的密集特征提取。与以密集高分辨率(精细)词元开始的模型不同,ARTA 从低分辨率(粗略)词元开始,并使用轻量级分配器来预测哪些区域需要更精细的词元。分配器迭代地预测语义(类)边界分数,并将附加词元分配给高于低阈值的补丁,将词元密度集中在边界附近,同时保持对弱边界证据的高敏感性。这种有针对性的分配鼓励词元表示单个语义类而不是类的混合。混合分辨率注意力可以实现粗标记和精细标记之间的交互,将计算集中在语义复杂的区域,同时避免同质区域中的冗余处理。实验表明,ARTA 在 ADE20K 和 COCO-Stuff 上以显着减少的 FLOP 实现了最先进的结果,并以明显较低的计算量在 Cityscapes 上提供了具有竞争力的性能。例如,ARTA-Base 在 ADE20K 上约 100M 参数类别中达到 54.6 mIoU,同时比同类骨干网使用更少的 FLOP 和更少的内存。