论文

RoMeRL:通过降阶效用状态平衡反馈覆盖率和自我进化代理内存中的内存奖励陷阱

RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States

上下文与知识记忆Agent记忆

摘要

用于自我进化的 LLM 智能体的基于学习的记忆系统面临着两个紧密耦合的挑战。首先,轨迹索引实用程序随着交互历史的增长而增长,从而将有限的反馈分散到不断扩大的状态空间中。其次,由于轨迹级奖励被联合分配给共同检索的记忆,因此不相关的经历可能会收到误导性的效用更新,从而进入记忆奖励陷阱。为了解决这些挑战,我们引入了降阶记忆强化学习(RoMeRL),它使用由结果极性和记忆动态分解的固定维每任务记忆状态来表示不断增长的轨迹索引效用空间。 RoMeRL 通过一组固定的语义坐标整合新的体验,这些坐标的内容会随着时间的推移而更新或替换,从而将反馈集中在有限的实用程序支持上。从理论上讲,我们表明这种降阶参数化增加了每个实用坐标收到的平均反馈,并描述了通用坐标转换模型下错误坐标的稳态占用情况。根据经验,在 ALFWorld 和 LifelongAgentBench 中,RoMeRL 提高了任务性能,将 Cold-Q 比率降低了 80.0%,将反馈密度提高了约 6.0 倍,将维护的内存大小减少了 84.4%,并将 LLM 调用减少了 21.1%。这些结果表明,降阶效用状态支持有效的自我进化代理记忆,同时限制持续的奖励污染。代码位于:https://github.com/YOUNG-fnxm/RoMeRL