论文

REViT-v2:层次窗口注意力扩展旋转反射等变视觉骨干

REViT-v2: Hierarchical Windowed Roto-reflection Equivariant ViT for Equivariant Feature Extraction

模型架构Transformer

摘要

我们提出了一种基于窗口组卷积自注意力和分层特征架构的可扩展的旋转反射组等变视觉变换器。我们证明了我们的方法可以扩展到具有数百万个参数的组等变视觉变换器 (ViT) 和具有实际大小图像的大型数据集,即 ImageNet。所提议的分层窗口 Roto 反射等变 ViT (REViT-v2) 的代码和预训练权重可在 https://github.com/kc-ml2/revit. 上获取