论文

无需显式关注的线性时间全局视觉建模

Linear-Time Global Visual Modeling without Explicit Attention

模型架构Transformer

摘要

现有研究很大程度上将 Transformer 的全局序列建模能力归因于注意力权重的显式计算,该过程本质上会产生二次计算复杂度。在这项工作中,我们提供了一个新颖的视角:我们证明注意力可以在数学上重新构建为配备动态预测参数的多层感知器(MLP)。通过这个镜头,我们解释注意力的全局建模能力不是作为显式的标记式聚合,而是作为一个隐式过程,其中动态生成的参数充当全局上下文的压缩表示。受这一见解的启发,我们研究了一个基本问题:我们能否完全通过动态参数化实现 Transformer 级序列全局建模,同时保持线性复杂度,有效取代显式注意力?为了探索这一点,我们设计了各种动态参数预测策略并将它们集成到标准网络层中。对视觉模型的广泛实证研究表明,动态参数化确实可以作为显式注意力的高效、线性复杂性替代方案,为高效序列建模开辟新途径。代码可在 https://github.com/LeapLabTHU/WeightFormer 获取。