论文

AllMem:一种以记忆为中心的高效长上下文建模方案

AllMem: A Memory-centric Recipe for Efficient Long-context Modeling

模型架构混合架构

摘要

大语言模型(LLM)在长序列任务中遭遇显著的性能瓶颈,其根源在于自注意力机制固有的计算复杂度与内存开销。为应对这些挑战,我们提出AllMem,一种新颖而高效的混合架构,将滑动窗口注意力(SWA)与非线性测试时训练(TTT)记忆网络相结合。AllMem使模型能够有效扩展至超长上下文,同时缓解灾难性遗忘。这一方法不仅克服了线性记忆模型典型的表征限制,还显著降低了长序列推理期间的计算与内存占用。此外,我们实现了一种内存高效微调策略,将预训练模型中的标准注意力层替换为记忆增强的滑动窗口层。该框架可将任何现成的预训练LLM高效转换为基于AllMem的架构。实证评估证实,我们的4k窗口模型在37k LongBench上取得近乎无损的性能,相比全注意力仅有0.83的微小下降。此外,在128k上下文的InfiniteBench上,我们的8k窗口变体优于全注意力,这验证了参数化记忆在抑制噪声、维持稳健长程建模方面的有效性,同时免除了全局注意力的高昂成本。

AllMem:一种以记忆为中心的高效长上下文建模方案
图1:记忆模块的模型架构:(左)单个解码器层结构,其中 Token Mixer 由两个并行分支组成:一个用于建模局部细粒度依赖的滑动窗口注意力(SWA)模块,以及一个用于捕获全局持久语义模式的长期 AllMem 记忆单元。(右)启用 TTT 的记忆单元的内部元参数结构,包括可学习的动量衰减率、学习率、输出门控分支和 QKV 投影权重。