论文

Salami攻击:针对OpenClaw的隐蔽协同记忆投毒

Salami Attack: Stealthy Collusive Memory Poisoning against OpenClaw

模型评测上下文与知识记忆安全与风险评测Agent记忆

摘要

长期记忆使LLM代理能够跨会话保留有用的信息,但同时也为攻击面提供了途径,使攻击者可以通过恶意记录单独操纵代理的持久记忆,从而引导其行为。现有的记忆攻击主要依赖于单独的恶意记录,忽视了组合威胁:多个看似安全的记录可能共同诱导不安全的行为。在这篇论文中,我们介绍了MemCollusion,一种用于构建协作记忆攻击的自动化红队框架。MemCollusion使用切片策略——一种将恶意目标切割成小而单独无害的部分的策略——生成看起来单独无害但共同有害的记忆片段。它使用四个设计约束、五个理论导向的策略以及一个微调的生成器来构建记忆联盟。为了在现实的跨会话设置中评估协作记忆攻击,我们开发了MoltLab,这是一个控制实验的Moltbook的再现,其中精心设计的内容必须首先被观察和提炼成持久记忆,然后在单独的会话中影响代理的行为。我们在OpenClaw上使用两个骨干模型在48个场景中评估了MemCollusion。在最严格的记忆节省设置下,MemCollusion在平均记忆节省率上达到81.3%,攻击成功率达到75.0%,并且在良性记忆稀释和记忆级防御的情况下仍然有效。

Salami攻击:针对OpenClaw的隐蔽协同记忆投毒:论文配图
图 1:MemCollusion 概述。 A. 记忆联盟生成器训练:第 1 步根据良性请求 qq、对抗性目标行为 gg、联盟大小 kk、四个约束和五个基于理论的构建策略构建监督训练数据。在第 2 步中,这些数据用于使用 LoRA 微调预训练的 LLM,生成专用的内存联盟生成器,该生成器生成单独看起来良性但集体有害的内存联盟。 B. 跨会话部署:在步骤 1 中,生成器生成一个特定于策略的内存联盟,其片段作为 MoltLab 帖子下的评论进行分发。在会话 1 期间,OpenClaw 观察内容并将其汇总到持久内存中。在步骤 2 中,会话 2 中仅提供良性请求 qq,其中存储的内存共同引导 OpenClaw 走向 gg。