论文

AttriMem:归因引导的过程反馈用于智能体记忆构建

AttriMem: Attribution-Guided Process Feedback for Agent Memory Construction

上下文与知识模型训练强化学习记忆Agentic RLAgent记忆

摘要

有效记忆对LLM智能体至关重要,但有效构建记忆仍具挑战。记忆构建策略决定随着交互累积,抽取、存储、更新、压缩或丢弃哪些信息。启发式记忆方法依赖主观的、任务专属的规则,可能与下游目标错位并限制跨任务适应性。基于RL的方法则从任务反馈学习,但主要使用结果级或模块级奖励:这些粗信号指示任务成功,却无法识别哪些中间记忆内容支撑了最终答案,形成细粒度信用分配瓶颈。然而构造这种过程反馈异常困难:中间记忆决策缺乏唯一真值目标,而恰当的信用随智能体不确定的推理轨迹变化、无法预先指定。我们提出AttriMem,一个以归因引导过程反馈学习记忆构建策略的RL框架:AttriMem用来自对最终答案的token级贡献的局部奖励增广全局结果奖励。在长程对话问答上的实验显示:AttriMem超越检索式、启发式与RL式基线,跨基准与答案模型泛化,并稳定RL优化。

AttriMem:归因引导的过程反馈用于智能体记忆构建:论文配图
图 1:AttriMem 概述。 AttriMem 通过提取、压缩和更新,从长期对话中构建结构化记忆库,然后通过记忆检索回答问题。在强化学习训练期间,令牌级归因会产生局部过程奖励,这补充了细粒度记忆学习的全局结果奖励。