论文
MemAudit:基于因果归因与结构异常检测的智能体记忆投毒事后审计
MemAudit: Post-hoc Auditing of Poisoned Agent Memory via Causal Attribution and Structural Anomaly Detection
摘要
大语言模型智能体日益依赖持久化记忆来存储过往交互、检索相关示例并改进长程任务执行。然而,这一记忆机制也带来了现实的安全漏洞:对抗性用户可通过普通交互向智能体记忆注入恶意记录,这些记录之后可能被检索到,从而左右智能体的推理与行动。现有防御主要聚焦在线干预,如提示过滤或输出拦截,但并未回答事后问题:当有害行为已被观测到时,究竟哪些存储的记忆是肇因。我们提出MemAudit,一个面向记忆增强LLM智能体的事后因果记忆审计框架。该框架结合两个互补信号:(1)反事实记忆影响分数,衡量每条记忆对有害输出的因果贡献;(2)记忆一致性图,在整体记忆库中识别结构异常的记忆。我们在MINJA上评估MemAudit,这是一种仅通过查询进行的记忆注入攻击,恶意记录经由正常智能体交互生成并存储,而非直接篡改记忆库。在问答与推理智能体两类设定中,MemAudit在现实的事后审计场景下大幅降低攻击成功率。结果显示,问答攻击成功率从 70% 降至 0%,RAP攻击成功率从 83.3% 降至 0%。
