论文

MemOps:长程对话中生命周期记忆操作的基准

MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

长期记忆已成为伴随用户跨长程多会话交互的LLM智能体的基础能力。但既有基准几乎只通过下游问答评估此类记忆——只给最终答案的正确性打分。这种黑盒表述混淆记忆失败的异质成因:错过相关事实的引入、把操作绑定到错误目标、或在更正后仍依赖过时值。结果是它可能在答案正确却依赖不一致或不安全记忆状态时给予加分。本文主张:在动态长程交互中,记忆不是事实的静态集合,而是显式操作的生命周期——包括记住、遗忘、更新、反思及其组合。我们提出MemOps:一个把对话记忆重构为生命周期操作序列的基准,以结构化轨迹表示每个记忆事件——指明其触发、目标、范围、状态转换与支撑证据。可控生成管线把这些操作嵌入长程任务导向对话,产出金标操作轨迹与六类操作级探针,在相邻证据与长上下文两种设定下评估。跨长上下文、检索式、参数式与托管记忆系统:MemOps分离了仅靠最终答案准确率掩盖的失败模式——揭示当前系统远未 uniformly 可靠。例如会话级检索优于轮级检索,而长上下文模型在重建有序记忆状态轨迹上明显薄弱。结果推动长期记忆评估从最终答案打分走向可解释的、操作级诊断。

MemOps:长程对话中生命周期记忆操作的基准:论文配图
图 1:现有长期内存基准测试与我们的 MemOps 之间的比较。