论文

MemGuard:为LLM智能体记忆治理持久化验证器信号

MemGuard: Persisting Verifier Signals for LLM-Agent Memory Governance

上下文与知识记忆Agent记忆

摘要

LLM智能体正从单次提示使用转向长任务流,在其中可复用记忆成为终端、软件工程与网页任务的核心能力。这种记忆只有在存储的经验在数百次交互中保持可靠时才有用,但实践中有两种失效模式打破了这一假设。第一种是不可靠准入:失败的轨迹、侥幸的成功和误导性的观察因为看起来相关而进入记忆,随后误导后续决策。第二种是记忆漂移:长期运行的记忆库积累重复、过时和冲突的记录,仅靠检索无法修复。MemGuard的关键区别在于不把验证器输出当作一次性过滤器,而是当作持久的生命周期元数据。它将多准则的分数-词元验证转换为奖励、置信度、标签和不确定性描述符,在每个候选激活之前附加到其上,并在检索、冲突消解、总结和归档期间复用。我们在Terminal-Bench 2.0、SWE-Bench Verified、WebArena和Mind2Web上、跨四个骨干评估MemGuard,在匹配的运行时预算下与四个记忆基线加一个仅验证器对照进行比较。在五个种子上取平均,MemGuard在全部16个骨干-基准设置中取得最佳成功指标与最低平均步数,相比ReasoningBank(我们评估的记忆方法中最强的先前基线)最大提升为:WebArena上7.9个成功率点,Mind2Web上5.6个步-成功率点,终端与软件工程基准上2.4-3.5个点。代码见 https://github.com/whyyyyy123/MemGuard。

MemGuard:为LLM智能体记忆治理持久化验证器信号:论文配图
图1:先前的经验记忆系统(如 Synapse (41)、AWM (28) 和 ReasoningBank (18))与 MemGuard 的对比。MemGuard 持久保存由验证器导出的描述符,以治理记忆准入、生命周期更新、质量感知检索和失败防护注入。