论文

MemAudit:基于因果归因与结构异常检测的智能体记忆投毒事后审计

MemAudit: Post-hoc Auditing of Poisoned Agent Memory via Causal Attribution and Structural Anomaly Detection

上下文与知识记忆Agent记忆

摘要

大语言模型智能体日益依赖持久化记忆来存储过往交互、检索相关示例并改进长程任务执行。然而,这一记忆机制也带来了现实的安全漏洞:对抗性用户可通过普通交互向智能体记忆注入恶意记录,这些记录之后可能被检索到,从而左右智能体的推理与行动。现有防御主要聚焦在线干预,如提示过滤或输出拦截,但并未回答事后问题:当有害行为已被观测到时,究竟哪些存储的记忆是肇因。我们提出MemAudit,一个面向记忆增强LLM智能体的事后因果记忆审计框架。该框架结合两个互补信号:(1)反事实记忆影响分数,衡量每条记忆对有害输出的因果贡献;(2)记忆一致性图,在整体记忆库中识别结构异常的记忆。我们在MINJA上评估MemAudit,这是一种仅通过查询进行的记忆注入攻击,恶意记录经由正常智能体交互生成并存储,而非直接篡改记忆库。在问答与推理智能体两类设定中,MemAudit在现实的事后审计场景下大幅降低攻击成功率。结果显示,问答攻击成功率从 70% 降至 0%,RAP攻击成功率从 83.3% 降至 0%。

MemAudit:基于因果归因与结构异常检测的智能体记忆投毒事后审计:论文配图
图 1:MemAudit 概述。给定有害事件 e=(q*,y*,R*)e=(q^{*},y^{*},R^{*}),框架对内存存储执行事后审核。它结合了两个互补信号:CMIS(通过反事实重放来测量检索到的记忆的因果贡献)和 MCG(识别全局记忆图中的结构异常记忆)。这两个信号被融合成一个解毒分数,用于对可疑记忆进行排名。删除排名靠前的记忆后,智能体变得更安全,同时保留了有用的记忆。