论文

研究用于图像识别的视觉 Transformer 中的单块递归

Investigating Single-Block Recurrence in Vision Transformers for Image Recognition

模型架构递归架构

摘要

Vision Transformer (ViTs) 通过堆叠独立参数化块来实现深度,但目前尚不清楚这种参数化有多少是必要的,以及有多少可以通过重复使用来替代。我们使用 bViT 研究这个问题,bViT 是一种单块循环 ViT,它重复应用相同的 Transformer 块,同时保留深度模型的迭代计算。在 ImageNet-1K 上,在相同的训练方案和计算预算下,bViT-B 的验证准确度达到 0.779,而 ViT-B 的验证准确度为 0.789,同时使用 8.6M 而不是 86.6M 参数。这种对应关系随着模型宽度的增加而变得更强,而窄的循环模型表现出巨大的性能差距。除了分类之外,单块公式还提供了一个受控测试台,用于研究 Transformer 计算如何随深度演变,因为可以跨循环步骤跟踪相同的头、神经元和权重矩阵。对注意力、激活模式和步骤条件谱修剪的分析揭示了共享参数的时间组织行为和步骤依赖的利用。 bViT 还可以竞争性地转移到下游任务,同时实现高度参数高效的适应。我们的工作表明,与独立参数化 ViT 深度相关的大部分性能可以通过重复使用单个足够宽的 Transformer 块来恢复。