论文
MEMAUDIT:面向预算约束下LLM长期记忆写入的精确包预言评测协议
MEMAUDIT: An Exact Package-Oracle Evaluation Protocol for Budgeted Long-Term LLM Memory Writing
摘要
长期LLM智能体必须在未来查询未知的情况下,把过去交互流压缩为持久记忆。现有评测通常测量最终问答准确率,这把记忆写入与检索、提示和读端推理纠缠在一起。我们提出MEMAUDIT,一个面向预算约束长期记忆写入的精确包预言(package-oracle)评测协议。MEMAUDIT包固定了经验流、候选记忆表示、存储成本、语义证据单元、未来查询要求与预算,把写入时的记忆选择变成一个带认证分母的有限可审计优化问题。我们以存储约束与每经验单表示约束下的凹-over-模态语义覆盖目标实例化该协议,用分支定界加MILP认证计算精确包最优。跨受控精确包、有效性压力测试、人工审计的自然支持切片以及导出的Mem0、A-Mem与Letta存储,MEMAUDIT分离出端到端QA无法定位的表示质量、有效性状态保持与预算感知选择效应。产物提供可复用的包生成器、认证求解器、自然包导出、外部系统打分器与缓存的可复现性元数据,用于评估记忆写入器在固定存储预算下实际保留了什么。
