论文
记得越多,风险越大:配备记忆的LLM智能体的纵向安全风险
Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents
摘要
对配备记忆的LLM智能体的安全评估通常衡量任务内安全:智能体能否在单个场景中安全完成任务,且往往处于提示注入或记忆投毒等对抗条件之下。然而在部署中,单个智能体会长期服务许多相互独立的任务,早期任务中积累的记忆可能影响后续无关任务上的行为。研究这一情形需要沿任务间的时间维度进行评估:不是问智能体在任一单一记忆状态下是否安全,而是问其安全状况如何随着记忆在大量独立交互中的累积而变化。我们将这种失败模式称为时间性记忆污染。为将记忆暴露与数据流非平稳性分离开来,我们提出触发探针(trigger-probe)协议,针对不同前缀长度的只读记忆快照评估固定的探针集,并配合用于识别记忆所致违例的NullMemory反事实基线。我们在涵盖记录、备忘录、表单与邮件往来的三类部署场景和八种记忆架构上应用该协议,并额外在使用平台原生记忆机制的Claw类AI智能体(如OpenClaw)上加以验证。启用记忆的智能体始终高于NullMemory基线,且在两类智能体上,记忆所致违例率都随暴露长度呈稳健的上升趋势。顺序随机化实验表明,这一效应主要由累积内容驱动,而非遭遇顺序。最后,事件分解的一个结构性推论是,记忆所致风险可以在生成之前从检索状态中被检测到,我们用高召回的诊断监视器证实了这一点。我们的结果主张将记忆安全视为需要时间性评估的纵向属性,而非一张快照便能刻画的单一状态属性。
