论文
从攻击成功到攻击严重性:LLM Agent的反事实内存攻击
From Attack Success to Attack Severity: Counterfactual Memory Attacks on LLM Agents
摘要
随着 LLM Agent越来越依赖持久内存来实现长期和个性化行为,他们可以在交互过程中保留和重用信息,但这也创建了一个持久的通道,恶意内存写入可以通过该通道影响未来的行为。持久内存攻击通常通过其是否成功来评估,但成功的攻击可能会导致持久状态产生截然不同的下游后果。我们将这种严重性作为一个独特的攻击设计目标来研究,并用反事实记忆后悔(CMR)将其形式化,即相对于干净记忆的预期下游损失的成对增加。我们引入了 MemHarm,它预先声明了稀疏、基础语义编辑的有限类,使用离线配对损失反馈通过正常Agent内存接口评估候选者,并验证该类中已解决的选择。与攻击成功优化相比,CMR 引导的选择会产生更大的下游损失,同时保留大部分成功率增益。在两个Agent基准测试和不同的内存设计中,MemHarm 在相同支持下评估的一般攻击中获得了最高的 CMR 点估计值。因素删除干预措施将这种危害与选定的语义因素联系起来,并且本机Agent部署验证写入新鲜进程的攻击路径。