论文
TransMem:将 大语言模型 的隐藏状态转换为内存
TransMem: Transforming Hidden States into Memory for Large Language Models
摘要
大语言模型 (LLM) 智能体越来越多地在长期交互历史中运行,其中有效的推理需要识别和利用分布在过去观察和行动中的任务相关证据。然而,在先前计算的表示中编码的有用信息在后续生成过程中通常没有得到充分利用。我们提出 \textbf{TransMem},一种轻量级推理时间参数化内存模块,它将稀疏的历史隐藏状态从冻结的 LLM 主干转换为可重用的内存表示。 TransMem 使用轻量级门控网络动态地将潜在干预应用于当前隐藏状态,而无需重复编码前面的上下文。为了学习可转移的记忆利用而不是特定于任务的知识,我们引入了证据条件的自我 蒸馏。记忆增强的学生处理完整的上下文,并与共享相同冻结主干的纯证据教师的预测分布相匹配。 LoCoMo、HotpotQA 和 MemoryAgentBench 上的实验证明了不同模型架构和规模的一致改进。 TransMem 在 LoCoMo 上获得了 11.58--29.25 $F_1$ 的收益,在 HotpotQA 上获得了 10.20--13.03 $F_1$ 的收益,同时将平均 MemoryAgentBench 准确度从 29.54% 提高到了 40.00%。这些结果将稀疏的历史隐藏状态建立为长上下文 LLM 代理的有效且高效的记忆基础。我们的代码可在 https://github.com/Haodong-Lei-Ray/TransMem 获取。