论文
记忆增强LLM代理中的状态污染
State Contamination in Memory-Augmented LLM Agents
摘要
LLM代理日益依赖持久状态——包括对话记录、摘要、检索上下文和记忆缓冲区——来支持长程交互。这使得安全性不仅取决于单个模型输出,还取决于代理存储及后续复用的内容。我们研究一种称为记忆洗白的失败模式:毒性或对抗性上下文可被压缩进记忆摘要,在标准检测器下不再显得有毒,却仍保留影响后续生成的敌意框架或冲突结构。通过配对反事实的多代理推演,我们表明源自毒性内容的记忆摘要可以保持在常见毒性阈值之下,同时相对于匹配的中性基线仍增加下游毒性。为度量这种隐藏影响,我们提出亚阈值传播差距(SPG),量化在部署监测器会判定为安全的记忆状态条件下,下游行为的差异。实验表明毒性经由不同的状态通道传播:原始对话记录复用驱动显性的下游毒性,而压缩记忆携带隐性的亚阈值影响。我们进一步发现,缓解效果关键取决于干预位置。在摘要化之前净化毒性状态能大幅缩小隐藏传播差距,而只清洗已完成的摘要则可能让洗白后的影响原封不动。这些结果表明,记忆增强代理的安全性应被视为对演化上下文的状态控制问题,并在不安全信息被压缩进持久记忆之前执行净化。
