论文
并非所有关注都是平等的:EEI 权衡的定量调查
Not All Attention Is Equal: A Quantitative Survey of the EEI Trade-off
摘要
十年来,从神经机器翻译到进行通用推理的语言模型,注意力机制一直在推动机器学习。这项调查涵盖了四个相互关联的线索:序列到序列任务的制定、对计算机视觉的适应、解决二次瓶颈的效率创新以及可解释性的进步。我们定义了三个标准:效率、表达力和可解释性,并使用 EEI 评分框架比较了 21 种方法。分数来自单个评估者,假设有 +/-1 分的扰动范围。对 200,000 个样本进行的确定性蒙特卡罗分析表明,在这种扰动模型下,平均 67-70% 的样本会发生不止一个位置的排名变化。排名匹配的空模型重现了类似的稳定性概况,因此结果支持粗略的层级比较,而不是细粒度的排名。该调查通过 Transformer 追踪了从 Bahdanau-Luong 对齐到视觉架构的注意力。它回顾了固定和学习的稀疏注意力、线性注意力、IO 感知精确算法(包括 FlashAttention)以及状态空间替代方案(包括 Mamba)。它还涵盖了感应头、叠加和注意力-SSM 二元性。我们进一步提供了结构化的叙述性评论、带有交叉研究注意事项的基准综合、五个问题的研究差距分析以及 2015-2026 年的演变时间表。最后,我们将注意力研究框架为效率-表达性-可解释性前沿的扩展,并确定未来的方向,包括统一的效率基准、混合架构的学习路由、长度泛化和可扩展的机械可解释性。