论文

当错误成为记忆:多轮记忆增强中的因果路径追踪 LLM

When Errors Become Memories: Causal Pathway Tracing in Multi-Turn Memory-Augmented LLMs

模型评测模型行为与机制分析

摘要

长期记忆使 大语言模型 (LLM) 能够在交互过程中保存和重用信息,但它也可能将局部错误转化为持久风险。现有的工作主要评估记忆系统是否正确存储和检索信息,对错误如何在响应、记忆状态和未来交互中传播的理解有限。我们提出了一种基于结构因果模型(SCM)的框架,用于内存增强 LLM 中的交叉转弯错误传播。我们将用户问题、模型响应和记忆状态建模为动态因果过程,并确定两个进入路径:内部记忆更新和外部问题反馈。通过干预这些途径,我们构建了四种反事实轨迹并量化了它们的下游影响和相互作用。错误影响在四个层面上进行评估:记忆保留、自然反应、有针对性的诊断探测和概率级错误偏好。实验表明,错误影响通常随着交互距离的增加而衰减,而记忆更新路径比问题反馈贡献更持久的影响;即使从自然反应中消失,潜在错误也可能仍然存在。传播模式也因内存类别和内存机制而异。路径引导恢复进一步验证了这种分解:问题修复将残余误差减少了 27.5%,记忆修复减少了 70.2%,联合修复减少了 98.3%,几乎消除了残余传播。