论文

LSTMem:大语言模型的分层长短期在线记忆

LSTMem: Hierarchical Long Short-Term Online Memory for Large Language Models

模型架构新型架构

摘要

大语言模型越来越多地充当长期助手和Agent,它们必须在交互过程中积累信息,并在以后的请求依赖于它们时提供相关部分。现有的紧凑型在线记忆通常使用单个持久状态来累积历史记录并提供读出服务,因此无法将记忆存储的内容与其暴露给当前计算的内容分开控制。我们提出了 LSTMem,这是一种受 LSTM 启发的在线记忆,它为冻结 LLM 的每一层配备了两个矩阵值状态:一个累积历史的单元状态和一个隐藏状态,其读数可纠正主干的注意力。输入门和遗忘门控制单元存储的内容,而输出门分别控制单元通过隐藏状态公开的内容。 LSTMem 通过前向隐藏状态传播和块端反馈进一步跨深度连接记忆,并在从浅层到深层重建隐藏状态之前使用高层重建梯度来细化低层单元状态。在 Qwen3-4B-Instruct 上的记忆基准测试中,LSTMem 在普通主干上持续改进 MemoryAgentBench、LoCoMo 和 HotpotQA。比较进一步表明,基于 LSTM 的记忆公式优于关联记忆公式,而消除跨层隐藏记忆传播会降低性能。这些结果证明了将记忆积累与记忆表达分开以及跨模型深度分层组织记忆的好处。该代码可在 https://github.com/Longchentong/LSTMem. 获取