论文
MAFIA:通过探测与事实注入对受审计LLM Agent发起仅查询记忆攻击
MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents
摘要
记忆增强的LLM代理依赖于丰富的上下文进行长期推理和行动,但其记忆模块暴露了一个持续的攻击面,使恶意记录攻击的研究成为必要。然而,现有的仅查询攻击往往在两个现实且常见的设置中失效:大规模的良性记忆池和主动输入审计。因此,当前的方法无法应对高检索竞争力和严格语义检查的双重挑战。为了克服这些限制,我们提出了MAFIA,一种通过探查和事实注入对抗审计来实现的仅查询的记忆攻击框架,专门针对这一扩展威胁模型。具体来说,MAFIA引入了:(1)一个确保检索竞争性注入的策略,包括记忆探查、预算分配和调度;以及(2)一个能够绕过审计的轻量级事实遮罩,保留恶意效果的同时保持高语义相似性。广泛的评估表明,MAFIA在攻击成功率达到90.7%的情况下,抑制了审计检测,从最高83.3%降至最多7.4%,揭示了关键漏洞存在于代理式的记忆系统中。代码将在https://github.com/JiamingChen1234/MAFIA公开。
