论文

长上下文混合模型的机制:从混合注意力到混合位置编码

Mechanics of Long-Context Hybrid Models Part 1.1: From Hybrid Attention to Hybrid Position

模型架构模型训练上下文与知识混合架构持续学习上下文工程

摘要

大型语言模型(LLM)的架构设计正在从传统的全注意力模型转向混合模型,混合模型结合不同的注意力模块来提高长上下文效率以及长度外推和上下文扩展的性能。为了解释混合模型为何有效以及如何更好地设计它们,我们提出了长上下文混合模型的机制。作为本系列的第 1.1 部分,我们从完全注意力和滑动窗口注意力 (SWA) 或线性注意力 (LA) 的门控变体的混合开始,以 GLA 和 GDN 为代表。我们首先观察到上下文扩展中的跷跷板效应:LA 混合体从长上下文持续预训练中受益更多,而 SWA 混合体在长度外推下表现更好。我们将这种行为归因于这些注意机制引起的位置归纳偏差的差异。我们发现 SWA 混合体存在短上下文学习陷阱、短窗口疲倦和长窗口惰性,并且需要扩展窗口来增强连续长上下文预训练的性能。对于LA混合模型,我们 总结了混合位置外推的马太效应,并提出了滑动窗口线性注意,实现了 16$\times$ 免训练长度外推,同时在 64k 上下文长度的 NIAH-SK1 上保持 100\% 的准确率。

长上下文混合模型的机制:从混合注意力到混合位置编码:论文原图
(a) Full Attention 和 SWA Hybrid 的结果。