论文

MemPoison:揭示多条记忆组合与条件触发带来的隐蔽投毒风险

MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents

模型评测上下文与知识智能体系统记忆Agent 动作执行与治理安全与风险评测Agent记忆

摘要

持久外部记忆提高了Agent交互的连续性,也带来持续性安全风险:攻击内容可经常规交互通道进入记忆,跨轮次保留,并在以后扭曲行为。为应对这一问题,本文提出MemPoison基准与分析框架,包含1,227个人工核验案例,覆盖四类攻击、三种注入通道和三种代表性记忆载体,并在七个开放权重与三个闭源模型系列上评测。框架区分三级风险:L1为直接污染单条记录,L2为多条记录组合后产生污染,L3为特定上下文触发的潜伏污染。实验显示,写入时的一致性检查等基线防护可显著抑制直接的L1攻击,却不能可靠抑制L2与L3。通过机制性影响分解,论文揭示了写入防护的结构盲点:看似无害的记录被允许保存,随后因联合检索或触发条件而产生危害。研究主张从静态过滤进一步发展为适应上下文的记忆防护。

MemPoison:揭示多条记忆组合与条件触发带来的隐蔽投毒风险 配图
图1:MemPoison中的直接污染、组合污染与条件触发污染。