论文

MemFail:对LLM记忆系统失效模式的压力测试

MemFail: Stress-Testing Failure Modes of LLM Memory Systems

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

大语言模型(LLM)智能体日益依赖外部记忆系统以在长程交互中保持一致性,但在理解这些系统呈现的具体失效模式与设计选择方面,实证工作却很少。现有基准报告聚合的问答准确率并将记忆系统视为黑箱,因此无法将一个错误答案归因于系统的某一特定失效模式。我们提出MemFail,一个能够隔离现代LLM记忆系统失效模式的诊断性基准。我们首先将记忆系统形式化为三种规范操作——摘要、存储与检索——的组合,并识别每种操作可能诱发的失效模式。基于这些假设的失效模式,我们构建了覆盖四类任务的五个数据集,每个数据集都经过对抗性设计,用以测试记忆系统的特定操作。利用这些数据集,我们在MemFail上评估四个最先进的记忆系统,并展示如何用MemFail从经验上理解记忆系统架构差异所带来的权衡。