论文
Salami攻击:针对OpenClaw的隐蔽协同记忆投毒
Salami Attack: Stealthy Collusive Memory Poisoning against OpenClaw
摘要
长期记忆使LLM代理能够跨会话保留有用的信息,但同时也为攻击面提供了途径,使攻击者可以通过恶意记录单独操纵代理的持久记忆,从而引导其行为。现有的记忆攻击主要依赖于单独的恶意记录,忽视了组合威胁:多个看似安全的记录可能共同诱导不安全的行为。在这篇论文中,我们介绍了MemCollusion,一种用于构建协作记忆攻击的自动化红队框架。MemCollusion使用切片策略——一种将恶意目标切割成小而单独无害的部分的策略——生成看起来单独无害但共同有害的记忆片段。它使用四个设计约束、五个理论导向的策略以及一个微调的生成器来构建记忆联盟。为了在现实的跨会话设置中评估协作记忆攻击,我们开发了MoltLab,这是一个控制实验的Moltbook的再现,其中精心设计的内容必须首先被观察和提炼成持久记忆,然后在单独的会话中影响代理的行为。我们在OpenClaw上使用两个骨干模型在48个场景中评估了MemCollusion。在最严格的记忆节省设置下,MemCollusion在平均记忆节省率上达到81.3%,攻击成功率达到75.0%,并且在良性记忆稀释和记忆级防御的情况下仍然有效。
