论文

Gated-SwinRMT:通过输入相关门控将 Swin 窗口注意力与保持曼哈顿衰减相结合

Gated-SwinRMT: Unifying Swin Windowed Attention with Retentive Manhattan Decay via Input-Dependent Gating

模型架构Transformer

摘要

我们介绍了 Gated-SwinRMT,这是一个混合视觉 Transformer 家族,它将 Swin Transformer 的移动窗口注意力与保持网络 (RMT) 的曼哈顿距离空间衰减结合起来,并通过输入相关的门控进行增强。自注意力被分解为每个移动窗口内连续的宽度方向和高度方向的保留通道,其中每个头的指数衰减掩模提供了二维局部性先验,而无需学习位置偏差。提出了两种变体。Gated-SwinRMT-SWAT 用 sigmoid 激活替代 softmax,通过乘法后激活空间衰减实现平衡 ALiBi 斜率,并通过 SwiGLU 门控值投影;归一化输出隐式抑制了无信息的注意力分数。 \textbf{Gated-SwinRMT-Retention} 保留了具有附加对数空间衰减偏差的 softmax 归一化保留,并结合了显式 G1 sigmoid 门——从块输入投影并在局部上下文增强(LCE)之后但在输出投影之前应用~$W_O$——以减轻低秩 $W_V \!\cdot\! W_O$ 瓶颈并启用对参与输出的输入相关抑制。我们在相同的训练协议下评估了 Mini-ImageNet($224{\times}224$,100 个类)和 CIFAR-10($32{\times}32$,10 个类)的两个变体,由于资源限制,使用单个 GPU。在 ${\approx}77$--$79$\,M 个参数下,Gated-SwinRMT-SWAT 在 Mini-ImageNet 上实现了 $80.22\%$ 和 Gated-SwinRMT-Retention $78.20\%$ top-1 测试精度,而 RMT 基线的测试精度为 $73.74\%$。在 CIFAR-10 上,小特征图导致自适应窗口机制削弱对全局范围的注意力,准确率优势从 $+6.48$\,pp 压缩到 $+0.56$\,pp。