论文

软递归混合:深入递归视觉 Transformer

Soft Mixture-of-Recursions: Going Deeper with Recursive Vision Transformers

模型架构递归架构

摘要

最近的递归 Transformer 研究主要在计算步骤中重用共享参数来构建紧凑、参数高效的模型。在这项工作中,我们利用递归有效地构建更深层次的具有更强表示能力的Transformer。然而,在 Vision Transformer 中,简单地增加递归深度并不能可靠地提高性能,因为现有的递归方法没有充分利用递归计算过程中产生的中间表示。我们提出软递归混合 (SoftMoR) 及其 Vision Transformer 实例化,软递归视觉 Transformer (SR-ViT)。 SoftMoR 学习 token-wise 混合权重,以柔和地组合所有递归步骤的输出,从而允许以可学习且灵活的方式利用中间表示。在不同的视觉任务中,SR-ViT 随着递归深度的增加而不断改进,并且参数开销最小。在 ImageNet-1K 上,将递归深度从 1 增加到 4 将 SR-ViT-S top-1 准确率从 79.83% 提高到 82.48%,仅需要 170 万个额外参数,在使用大约 27% 的参数时,性能优于更大的 DeiT-B。这些结果表明,SoftMoR 通过递归提供了一条参数有效的路径,以实现更深更强的 Vision Transformer。