论文

重新思考高效注意力在混合架构中的作用

Rethinking the Role of Efficient Attention in Hybrid Architectures

模型架构混合架构

摘要

现代语言模型越来越多地采用混合架构,将充分注意力与高效注意力模块相结合,例如滑动窗口注意力(SWA)和循环序列混合器。然而,人们对这些高效模块如何塑造模型功能仍知之甚少。为了解决这一差距,我们从三个角度对混合架构进行了系统分析:扩展行为、机制分析和架构设计。首先,从扩展的角度来看,我们发现高效注意力设计主要影响长上下文能力的出现速度,而不同的混合体最终在足够的训练下收敛到可比较的长上下文性能。其次,从机制上讲,我们表明长程检索主要由充分注意力进行,而有效注意力则塑造其优化轨迹。这解释了我们称之为大窗口惰性的反直觉现象:较大的 SWA 窗口可以延迟全注意力层中检索头的形成。第三,在这种机制的指导下,我们证明仅将 NoPE 应用于小窗口 SWA 混合的全注意力层可以显着提高长上下文性能,而对短上下文性能的影响可以忽略不计。