论文

MAFIA:通过探测与事实注入对受审计LLM Agent发起仅查询记忆攻击

MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents

模型评测上下文与知识记忆安全与风险评测Agent记忆

摘要

记忆增强的LLM代理依赖于丰富的上下文进行长期推理和行动,但其记忆模块暴露了一个持续的攻击面,使恶意记录攻击的研究成为必要。然而,现有的仅查询攻击往往在两个现实且常见的设置中失效:大规模的良性记忆池和主动输入审计。因此,当前的方法无法应对高检索竞争力和严格语义检查的双重挑战。为了克服这些限制,我们提出了MAFIA,一种通过探查和事实注入对抗审计来实现的仅查询的记忆攻击框架,专门针对这一扩展威胁模型。具体来说,MAFIA引入了:(1)一个确保检索竞争性注入的策略,包括记忆探查、预算分配和调度;以及(2)一个能够绕过审计的轻量级事实遮罩,保留恶意效果的同时保持高语义相似性。广泛的评估表明,MAFIA在攻击成功率达到90.7%的情况下,抑制了审计检测,从最高83.3%降至最多7.4%,揭示了关键漏洞存在于代理式的记忆系统中。代码将在https://github.com/JiamingChen1234/MAFIA公开。

MAFIA:通过探测与事实注入对受审计LLM Agent发起仅查询记忆攻击:论文配图
图 2:MAFIA 管道。探针查询通过普通交互界面进入;攻击者仅记录代理答案或操作中出现的历史问题字段,而不记录内部 top-KK 记录或检索输出。这些浮出水面的问题指导着集群、预算分配和调度。然后紧凑的事实斗篷通过相同的接口进入并通过正常的写入路径存储;稍后的受害者查询可以检索生成的中毒记录。