论文

前置注意力:提高 Transformer 的效率

Preconditioned Attention: Enhancing Efficiency in Transformers

模型架构Transformer

摘要

Transformer 成功的核心是注意力模块,它有效地模拟与数据集关联的输入标记之间的全局依赖关系。然而,我们从理论上证明,Transformer 中的标准注意机制通常会产生具有大条件数的病态矩阵。这种病态条件是基于梯度的优化器的一个众所周知的障碍,导致训练效率低下。为了解决这个问题,我们引入了预处理注意力,这是一种将条件矩阵合并到每个注意力头中的新颖方法。我们的理论分析表明,该方法显着减少了注意力矩阵的条件数,从而产生更好的条件矩阵,从而改善优化。条件性注意力可以作为文献中各种注意力机制的简单替代品。我们在一系列不同的 Transformer 应用程序中验证了预处理注意力的有效性,包括图像分类、对象检测、实例分割、长序列建模和语言建模。