论文

动态线性注意力

Dynamic Linear Attention

模型架构Transformer

摘要

大语言模型(LLM)对长上下文的可扩展性从根本上受到标准注意力的二次复杂度的限制,这促使采用具有次二次成本的线性注意力机制。为了提高长上下文下的表示能力,最近的方法以多状态方式组织记忆。然而,现有的多状态线性注意方法依赖于固定的状态合并策略,无法适应动态变化的词元重要性,不可逆地模糊关键词元并导致长序列上严重的错误累积。为了解决这个限制,我们提出了 DLA,一种用于多状态线性注意力的动态记忆建模框架。 DLA 引入了 (i) 信息感知动态状态合并,它根据 词元级 信息变化自适应地确定状态边界,保留围绕语义转换的高分辨率表示,同时积极总结稳定区域;以及 (ii) 容量限制内存建模,它通过有选择地合并相邻的低信息状态来控制内存增长,以最小的信息丢失来维护固定大小、按时间顺序排序的状态缓存。我们在两种不同的线性注意力模型上预训练 DLA,并在三个类别的 16 个数据集上进行评估。实验结果证明了 DLA 相对于最先进技术的优越性。