论文
MemTrace:探查最终准确率在长期记忆中漏掉的东西
MemTrace: Probing What Final Accuracy Misses in Long-Term Memory
摘要
LLM智能体日益维护跨会话的用户事实长期记忆。但此类记忆通常以对问题行或episode聚合准确率来评估。因为该方法独立为问题行打分——即便多个问题探查同一事实——它无法展示该事实随条件变化的行为。我们介绍MemTrace——测量单位为知识点(关于用户的一条带类型事实——而非单个问题)的基准。MemTrace沿三个受控维度探查每条事实:记忆年龄(该事实出现在多少会话之前)、问题类型(当前状态、先前状态与变化轨迹)与证据条件(在场、缺失与被假前提反驳)。跨四个范式评估13个记忆系统配置——我们发现相似的池化准确率隐藏不同失败:恢复事实的当前与先前状态不意味着追踪它如何变化——安全弃答不意味着纠正假前提。主导瓶颈是证据使用而非检索:系统失败时——证据可检索的情形是证据缺失的10倍。这些结果表明:改进长期记忆需要更好地使用可达证据——而非简单地更多存储或检索。
