论文
MemChain:为记忆增强LLM智能体学习可解释的记忆轨迹
MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents
摘要
记忆增强的LLM智能体通常通过检索相关记忆并将其直接喂给答案模型来回答查询。这种“检索即证据”范式假设检索到的记忆已适合推理,把冗余、冲突与弱相关的处理留给答案模型,并在长期记忆任务中带来可观的上下文开销。我们提出MemChain,一种可训练的检索后记忆策略,把检索候选转化为面向答案的活跃记忆,表示为紧凑且有依据的证据上下文。给定用户查询与检索候选,MemChain先生成问题条件化的证据计划,再构建一条有序且有依据的证据轨迹,按语义角色与依赖关系组织检索到的记忆,最后执行显式记忆动作,产出用于答案生成的简洁证据上下文。为训练该中介器,我们引入两阶段学习框架。监督轨迹学习先教会策略生成结构上合法的计划、轨迹、动作与证据上下文。随后我们提出轨迹引导记忆策略优化(Trace-Guided Memory Policy Optimization, TMPO),一种用下游答案质量优化记忆策略的强化学习目标,同时在多个rollout上联合鼓励轨迹有据、证据支撑、结构合法与答案稳定。在LoCoMo与LongMemEval-S上的实验表明,MemChain在闭源与开源权重的冻结答案模型上都稳定取得最先进性能,同时大幅减少传给答案模型的记忆上下文。
