论文
论线性注意力在多模态中的应用 Transformer
On The Application of Linear Attention in Multimodal Transformers
摘要
多模态 Transformer 是最先进的视觉语言模型的支柱,但其二次注意力复杂性仍然是可扩展性的关键障碍。在这项工作中,我们研究了线性注意力(LA)作为多模式框架内的高效替代方案的可行性。通过集成 LA,我们将相对于序列长度的计算开销从二次减少到线性,同时保持有竞争力的性能。我们评估了在 LAION-400M 数据集上训练的 ViT-S/16、ViT-B/16 和 ViT-L/16 架构的方法,验证重点是 ImageNet-21K 零样本精度。我们的系统评估表明,线性注意力不仅可以显着节省计算量,而且还遵循与标准 softmax 注意力相同的缩放法则。这些发现将线性注意力定位为下一代多模态 Transformer 的强大、可扩展的解决方案,其任务是处理日益庞大和复杂的数据集。