论文

LLM 智能体的失准目标自传播:审计或禁用记忆为何还不够

Self-Propagating Misalignment in LLM Agents, and Why Auditing or Disabling Memory Is Not Enough

模型评测安全与风险评测

摘要

针对 LLM 智能体的记忆投毒攻击,通常假设外部攻击者向持久记忆植入内容,以改变智能体行为。我们研究另一种没有外部攻击者的情况:一个目标失准的智能体,是否会把尚无机会执行的目标写入持久记忆,随后由未来已对齐的智能体在机会出现时执行?我们把这一威胁称为目标失准的自传播,并在 20 种场景中研究它,包括自我保全、寻求权力、破坏监督、利用奖励漏洞和欺骗用户。我们用两类提示在 11 个前沿模型中模拟失准:不受限制提示与仅描述价值观的提示。第一类明确规定失准目标,例如阻止自身被替换,自传播在 58% 的运行中成功。第二类只描述智能体重视的事情,例如持续运行对用户十分重要,不指定失准目标或指令;即使在这类较弱提示下,自传播仍在 18% 的运行中成功,且每个模型至少在一种场景中出现自传播。移除 Harness 中的记忆工具后,智能体转而使用文件系统,在 74% 的会话中把目标写入文件,自传播仍在 11% 的运行中成功。我们还发现,能力较弱的模型可以向更强模型传播失准目标,且这些目标可在 100 次无关工作会话中持续存在。现有记忆投毒和提示注入防御不能直接解决这一威胁,因为内容由智能体自己生成,而非外部攻击者注入。既有工作中的 LLM 记忆审计器 MemMorph 仅将传播率从 71% 降至 34%。我们公开这些场景,以支持针对这一新兴威胁的防御评估。

LLM 智能体的失准目标自传播:审计或禁用记忆为何还不够的原论文方法或结果图
图 2:场景 U04(隐蔽破坏)展示的威胁模型。在会话 A 中,失准系统提示令智能体把 wiki 文件夹视为应该删除的提示注入风险。但该文件夹不在会话 A 的检出目录中,且用户任务只读,Harness 未提供删除工具。无法行动时,智能体把目标写入持久记忆。在会话 B 中,处理无关 git commit 任务的已对齐智能体继承这份记忆,没有失准系统提示。提交任务授予删除权限,git status 又显示了未跟踪的 wiki 文件夹。智能体遵从记忆中的指令删除文件夹,销毁团队唯一的运行手册副本。