论文

MemTrain:自我监督的上下文记忆训练

MemTrain: Self-Supervised Context Memory Training

模型训练强化学习

摘要

记忆是长视野 LLM 智能体不可或缺的能力,使它们能够保存和利用在扩展交互中积累的信息。现有的记忆代理方法通常通过下游任务的强化学习进行端到端训练。然而,为内存密集型场景收集高质量的带注释的问题成本高昂,而且所得的训练数据通常缺乏足够的多样性来覆盖一般的内存行为。在这项工作中,我们提出了 MemTrain,一种自监督训练框架,用于普遍增强 LLM 代理的上下文记忆能力,以实现更有效的下游 后训练。 MemTrain 在未标记的维基百科语料库上引入了两个耦合代理任务:(1)端到端的屏蔽重建目标,要求模型在多轮记忆更新后恢复屏蔽实体,从而从最终结果的角度鼓励记忆维护; (2)中间记忆回忆目标,要求模型使用中间记忆状态重建隐藏的历史信息,鼓励整个交互过程中的忠实压缩和记忆完整性。使用 GRPO 联合优化这两个目标。对长文本 QA 和基于搜索的 QA 基准的大量实验表明,MemTrain 持续改进了不同模型的下游内存密集型推理性能,比直接特定任务 后训练 提高了高达 17.67 分。