论文

共享产物与持久记忆可能传播跨Agent攻击

Share-Borne AI Virus: Memory-Hopping Attacks Across LLM Agents

模型评测上下文与知识记忆安全与风险评测Agent记忆

摘要

大语言模型越来越多地部署为有状态助手,可以在交互过程中保留信息,并使用工具来读取、修改和创建持久工件。由于这些工件在用户之间共享,因此它们在其他独立的助手之间形成了间接的沟通渠道。我们研究了一种故障模式,在这种模式下,该通道可以进行自我传播攻击。我们引入了工件介导的传播,其中通过工件(例如报告)引入的对抗性内容存储在助手的持久存储器中,在随后创建的工件中再现,并由稍后读取它的另一个助手获取。我们在时间人类Agent宇宙中评估这一过程,模拟随着时间的推移独立操作的助手之间的工件交换,测量攻击是否能够在连续的交接中幸存下来,它到达了多少跳,以及它的传播范围。我们发现攻击可以在多个独立助手之间传播,并在扩展的交互序列中持续存在。在更大的模拟环境中,甚至 GPT-5.6 Luna 也表现出巨大的传播能力,达到 60-80% 的Agent,传播链延伸至八跳。这些结果表明,持久性工件可以充当对抗状态的持久载体,使攻击能够比个体交互更持久,并在孤立的助手中传播。