论文
AllMem:一种以记忆为中心的高效长上下文建模方案
AllMem: A Memory-centric Recipe for Efficient Long-context Modeling
摘要
大语言模型(LLM)在长序列任务中遭遇显著的性能瓶颈,其根源在于自注意力机制固有的计算复杂度与内存开销。为应对这些挑战,我们提出AllMem,一种新颖而高效的混合架构,将滑动窗口注意力(SWA)与非线性测试时训练(TTT)记忆网络相结合。AllMem使模型能够有效扩展至超长上下文,同时缓解灾难性遗忘。这一方法不仅克服了线性记忆模型典型的表征限制,还显著降低了长序列推理期间的计算与内存占用。此外,我们实现了一种内存高效微调策略,将预训练模型中的标准注意力层替换为记忆增强的滑动窗口层。该框架可将任何现成的预训练LLM高效转换为基于AllMem的架构。实证评估证实,我们的4k窗口模型在37k LongBench上取得近乎无损的性能,相比全注意力仅有0.83的微小下降。此外,在128k上下文的InfiniteBench上,我们的8k窗口变体优于全注意力,这验证了参数化记忆在抑制噪声、维持稳健长程建模方面的有效性,同时免除了全局注意力的高昂成本。
