论文
MemTrace:跟踪和归因 大语言模型 内存系统中的错误
MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems
摘要
内存对于 大语言模型 支持长视野推理至关重要,但现有内存系统仍然不可靠且难以调试。追踪记忆的动态演化对于理解信息如何随时间合成、传播或损坏至关重要。在这项工作中,我们研究了 LLM 内存系统中的错误跟踪和归因的新问题。我们提出了一种新颖的框架,可将内存管道转换为可执行的内存演化图,从而实现操作信息流的细粒度跟踪。然后,我们构建了 MemTraceBench,这是从 Long-Context、RAG、Mem0 和 EverMemOS 等代表性内存系统收集的基准,以系统地研究内存故障模式。我们进一步引入了一种自动归因方法,该方法可以迭代跟踪操作子图以查明任何失败案例的根本原因。我们的分析表明,内存故障是系统性的,源于操作层面的问题,例如信息丢失和检索错位。至关重要的是,我们利用这些细粒度的归因信号来指导下游提示优化,建立自动纠正故障的闭环系统,并将最终任务性能提升高达 7.62%。代码将在 https://github.com/zjunlp/MemTrace 发布。