论文
通过关联循环内存扩展 LLM 上下文
Extending LLM Context via Associative Recurrent Memory
摘要
扩展 大语言模型 (LLM) 的上下文长度对于许多实际应用程序至关重要,但标准 Transformer 仍然受到二次计算和线性内存扩展的限制。在这项工作中,我们研究了关联循环内存 Transformer (ARMT) 作为一种实用方法,用于在 LLM 中实现长上下文处理、恒定内存扩展和更高的效率。我们做出了三项主要贡献。首先,我们构建了两个特定领域的长上下文数据集,旨在评估实际工作负载,重点关注窄域 微调 场景。其次,我们提出了基于 ARMT 的上下文扩展的综合训练方法,结合了持续的 预训练、合成长上下文数据生成、课程学习以及将联想记忆选择性地集成到所选模型层中。第三,我们提出了一项广泛的实验研究,证明 ARMT 增强模型:(i)处理远远超出其原始上下文限制的输入,而不会降低相对于极限基线的性能; (ii) 更有效地推广到分布范围之外的长度; (iii) 需要减少 30% 的 FLOP,同时保留原始上下文窗口内的基线性能。