论文

MEMAUDIT:面向预算约束下LLM长期记忆写入的精确包预言评测协议

MEMAUDIT: An Exact Package-Oracle Evaluation Protocol for Budgeted Long-Term LLM Memory Writing

模型评测上下文与知识记忆评测方法与指标Agent记忆

摘要

长期LLM智能体必须在未来查询未知的情况下,把过去交互流压缩为持久记忆。现有评测通常测量最终问答准确率,这把记忆写入与检索、提示和读端推理纠缠在一起。我们提出MEMAUDIT,一个面向预算约束长期记忆写入的精确包预言(package-oracle)评测协议。MEMAUDIT包固定了经验流、候选记忆表示、存储成本、语义证据单元、未来查询要求与预算,把写入时的记忆选择变成一个带认证分母的有限可审计优化问题。我们以存储约束与每经验单表示约束下的凹-over-模态语义覆盖目标实例化该协议,用分支定界加MILP认证计算精确包最优。跨受控精确包、有效性压力测试、人工审计的自然支持切片以及导出的Mem0、A-Mem与Letta存储,MEMAUDIT分离出端到端QA无法定位的表示质量、有效性状态保持与预算感知选择效应。产物提供可复用的包生成器、认证求解器、自然包导出、外部系统打分器与缓存的可复现性元数据,用于评估记忆写入器在固定存储预算下实际保留了什么。

MEMAUDIT:面向预算约束下LLM长期记忆写入的精确包预言评测协议:论文配图
图 1:MemAudit 在检索和读者推理之前评估写入的内存存储。冻结包定义了确切的写入时间分母,而下游 QA 通过可选的检索器/读取器分支单独测量。