论文
视觉 Transformer 前馈网络的正交二次补
Orthogonal Quadratic Complements for Vision Transformer Feed-Forward Networks
摘要
最近对视觉 Transformer 的双线性前馈替代可以显着提高准确性,但它们经常混淆两种效果:更强的二阶相互作用和相对于主分支增加的冗余。我们研究了一种补充设计原则,其中辅助二次特征仅贡献尚未被主导隐藏表示捕获的信息。为此,我们提出正交二次补(OQC),它构造一个低秩二次辅助分支,并在注入之前将其显式投影到主分支的正交补上。我们进一步研究了有效的低秩实现(OQC-LR)和门控扩展(OQC-静态和OQC-动态)。在参数匹配的 Deep-ViT 和 CIFAR-100 协议下,具有固定的倒数第二个残差读数,完整的 OQC 将 AFBO 基线从 64.25 +/- 0.22 提高到 65.59 +/- 0.22,而 OQC-LR 达到 65.52 +/- 0.25,并具有更好的速度精度权衡。在 TinyImageNet 上,门控扩展 OQC-dynamic 达到 51.88 +/- 0.32,将基线 (50.45 +/- 0.21) 提高了 1.43 个点,并且优于所有非门控变体。机制分析显示,投影后辅助-主重叠接近于零,同时改进了表示几何形状和类分离。完整的家族,包括非门控和门控变体,在两个数据集上一致地概括。