论文

DnA:视觉任务的注意力去噪

DnA: Denoising Attention for Visual Tasks

模型架构Transformer

摘要

多头注意力(MHA)中的 softmax 激活是视觉感知任务中基于注意力的模型的事实上的标准。然而,标准的 softmax 会产生嘈杂的注意力模式,从而稀释相关特征并降低其性能。在本文中,我们提出了去噪注意力(DnA),其中,首先,正查询识别哪些图像特征属于正确的类别,负查询识别密切相关但不相关的图像特征。然后,DNA 将这些相互作用投射到两个具有较大主角的不同子空间中,从而促进子空间分离并提高可辨别性。使用 ViT-B 主干,我们提出的 DnA 在 ImageNet-1K 上与基线相比实现了 0.8% 的绝对增益。我们进一步展示了多个视觉理解任务的改进,包括视频 Transformer (1.8%) 和视频 LLM (0.5%) 的视频理解。我们广泛的实证分析证明了涉及两个相互作用的子空间和 DNA 去噪效果的设计选择的合理性。