论文
$\mathrm{O}(2)$ 离散子群等价的视觉 Transformer 统一框架
A Unified Framework for Vision Transformers Equivariant to Discrete Subgroups of $\mathrm{O}(2)$
摘要
Vision Transformer 已成为视觉识别的主导架构。然而,标准模型没有明确编码许多视觉领域中出现的平面对称性。我们引入了一系列与$\mathrm{O}(2)$的任意离散子组等价的视觉Transformer,提供了一个统一的框架来概括先前的翻转和$D_4$等价Transformer架构。我们的构造产生了核心 Transformer 组件的等变类似物,以及所得层的表现力保证。特别是,我们表明,每当 $H \le G$ 时,$G$ 等变 ViT 类自然嵌入到 $H$ 等变 ViT 类中。我们还证明,在单头设置中,相应的等变自注意力层实现了普通自注意力可表示的每个$G$-等变自注意力图。我们进一步构建了一个基于六边形补丁的$D_6$等变模型,使该架构与六重旋转对称兼容。我们在 $D_4$ 和 $D_6$ 子组中人为数据稀缺的情况下,在 PatternNet 航空图像数据集上评估生成的模型。我们的实验比较了两种等变注意机制,并分析了非线性中使用的同质空间配置的选择如何影响性能。匹配参数预算下的初步结果表明,等方差可以提高识别精度,从而激发了进一步研究离散对称群如何塑造基于 Transformer 的视觉识别模型。