论文

VerMem:以局部和全局验证器统一学习Agent记忆管理

Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents

上下文与知识模型训练强化学习上下文工程记忆Agentic RLAgent记忆

摘要

大语言模型(LLM)代理必须保留可重用信息,控制受限制的主动上下文,并在长时间跨度的交互中恢复早期证据。现有方法通常单独优化长期记忆(LTM)和短期记忆(STM),而统一策略往往主要通过轨迹级反馈进行训练,这为个体记忆决策提供了弱信用。我们提出了可验证记忆(VerMem),这是一个框架,将LTM、主动上下文和递归历史作为独立状态,并用一个记忆操作策略控制它们。七个原子操作允许政策添加、修订或软删除LTM条目;检索LTM到主动上下文;过滤或总结主动上下文;以及恢复选定的递归片段。VerMem由监督微调初始化,并通过三个阶段强化学习课程进行训练。本地验证器评分可执行的记忆过渡,全局验证器在任务完成后评估证据一致性与终端记忆的一致性。这些分数通过层次化信用分配与程序化计算的任务、证据回忆、效率和约束信号相结合。验证器仅在训练期间使用。在五个基准测试和两个LLM后端上,VerMem在大多数报告的度量指标上取得最佳结果,并且始终优于强记忆基线。在三个交互性基准上的受控在线令牌预算下,它也取得了最强的效率-性能前沿。代码可在https://github.com/Sun-SYSU-24/VerMem处获得。

VerMem:以局部和全局验证器统一学习Agent记忆管理:论文配图
图1 : VerMem概述。左:记忆操作策略协调长期和短期记忆工具,以维护长期记忆和活动环境。历史上下文恢复恢复LLM的相关情节历史,其行为和答案将记录在随后的步骤中。右:三阶段课程生成KK状态化推出。 本地验证器评估可执行内存转换,而全局验证器评估任务完成后的证据一致性和终端内存一致性。这些分数有助于将本地和全球优势分开归一化;约束成本仍然是分开的。Verifier分支仅在培训期间使用。