论文
Agent记忆系统能否追踪演化状态?
Can Agent Memory Systems Track Evolving State?
摘要
随着基于LLM的Agent被部署于更长时程、更高风险的任务,其记忆系统仍然存在关键缺口。现有记忆基准主要聚焦回忆型任务,而我们主张有效的记忆系统必须追踪世界的演化状态:当事实、约束和决定在长交互中被修订时,答案必须反映当前状态而非已被取代的状态。我们将这一能力定义为状态追踪,并将其实例化为StateMemBench,一个包含234个多会话场景、覆盖两种对话长度区制的基准。其封闭池打分评判答案反映的是当前状态、被取代状态还是失败,从构造上把状态追踪失败与其他错误区分开。我们的分析表明,这一任务对现有记忆系统、检索增强基线和长上下文基线都具挑战性。随后我们提出StateMem,一种以状态为先的记忆方法,显式追踪取代关系与关系依赖,并显示其在DeepSeek-V4-Flash上把当前状态准确率相对最强同骨干基线提升1.8倍(0.205 -> 0.363),在Qwen-3.5-9B上相对最强记忆系统提升1.6倍(0.149 -> 0.233),同时与长上下文基线保持竞争力。最后,我们展示同一状态方法可作为轻量单次调用包装器叠加于现有记忆系统之上,在StateMemBench上跨六个记忆与检索后端把当前状态准确率提升+32到+67个百分点。一项长度与成本匹配的对照实验将其中+15到+32个百分点归因于状态结构而非新增上下文。
