论文
记忆传染:评估者偏差通过代理记忆进行跨时传播
Memory Contagion: Cross-Temporal Propagation of Evaluator Bias via Agent Memory
摘要
大语言模型 (LLM) 智能体越来越依赖记忆系统来维持长期一致性。最近的研究表明,智能体记忆在持续巩固过程中会退化。然而,现有的研究假设记忆来自公正的经历。在这项工作中,我们识别并形式化了一种新现象:记忆传染——评估者偏差通过代理记忆进行跨时传播。我们表明,当智能体受到有偏见的评估者的培训或指导时,他们的经验就会变得有偏见;当这些轨迹被存储并合并到内存中时,偏差会传播到从同一内存存储中检索的未来代理,即使合并是完美的(oracle)。在两种偏差类型(长度偏好、权威偏差)和四个实验阶段,我们证明:(1)即使在旧模型(Gamma_A = 13.18,DeepSeek V4-Chat)上完美整合,长度偏差也会发生记忆传染,而较新的模型(V4-Pro,Claude)是免疫的,证明偏差输入是一个充分的原因,并且传染是模型生成相关的; (2) 权威偏差未能在所有 15 个受控多种子实验中传播(Gamma_A = 0.00),这表明并非所有评估者偏差都可以通过当前的内存架构跨越时间边界; (3) 没有观察到的安全阈值:在污染率低至 p=0.2 时检测到长度偏差传播。我们的研究结果揭示了当前代理内存设计中的一个关键但偶然的漏洞,并为测量跨时间偏差传播提供了正式的工具。