论文

MemAudit:通过隐藏用户状态恢复审核长期代理内存

MemAudit: Auditing Long-Term Agent Memory via Hidden User-State Recovery

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

长期记忆使 LLM 代理能够在会话中变得更加强大,从而保持对交互形成的用户的准确、不断发展的理解。然而,在实践中,这种记忆主要是通过下游行为来评估的,例如后来的答案、个性化质量或任务成功,这仅间接测试理解程度,而记忆工件本身在很大程度上未经审核。我们认为,长期记忆应该被评估为可审计的交互后工件:在普通协助之后,可以从代理留下的记忆中重建什么结构化的用户状态?我们在 MEMPROBE 中实例化了这个视图,这是一个基准测试,其中配备内存的代理协助模拟用户,每个用户都携带一个隐藏的、分类锚定的用户状态库,跨越泄漏控制任务的轨迹,之后该库在全存储和 top-k 访问下根据代理生成的内存重建。 MEMPROBE 基于合成 真值 构建,可实现高效、可扩展的测量,涵盖 50 个模拟用户,每个用户有 31 个隐藏维度(1,550 个恢复目标),并测试 5 个代表性内存系统。通过测试最先进的记忆代理,我们发现成功的帮助和可恢复的记忆表现为不同的功能。即使对于无记忆基线,任务完成率也接近饱和,而类别平衡恢复保持中等水平(约 0.6),并且在 top-k 检索下进一步下降。 MEMPROBE 是第一个直接研究内存恢复的基准测试,它重建系统保留的用户状态并根据 真值 对其进行评分。我们将恢复视为未来记忆代理优化的具体目标,而 MEMPROBE 则视为迈向这样一个环境的一步:在该环境中,代理接受训练以记住其用户,并且了解用户的时间越长,就越忠实。