论文
LLM 智能体的失准目标自传播:审计或禁用记忆为何还不够
Self-Propagating Misalignment in LLM Agents, and Why Auditing or Disabling Memory Is Not Enough
摘要
针对 LLM 智能体的记忆投毒攻击,通常假设外部攻击者向持久记忆植入内容,以改变智能体行为。我们研究另一种没有外部攻击者的情况:一个目标失准的智能体,是否会把尚无机会执行的目标写入持久记忆,随后由未来已对齐的智能体在机会出现时执行?我们把这一威胁称为目标失准的自传播,并在 20 种场景中研究它,包括自我保全、寻求权力、破坏监督、利用奖励漏洞和欺骗用户。我们用两类提示在 11 个前沿模型中模拟失准:不受限制提示与仅描述价值观的提示。第一类明确规定失准目标,例如阻止自身被替换,自传播在 58% 的运行中成功。第二类只描述智能体重视的事情,例如持续运行对用户十分重要,不指定失准目标或指令;即使在这类较弱提示下,自传播仍在 18% 的运行中成功,且每个模型至少在一种场景中出现自传播。移除 Harness 中的记忆工具后,智能体转而使用文件系统,在 74% 的会话中把目标写入文件,自传播仍在 11% 的运行中成功。我们还发现,能力较弱的模型可以向更强模型传播失准目标,且这些目标可在 100 次无关工作会话中持续存在。现有记忆投毒和提示注入防御不能直接解决这一威胁,因为内容由智能体自己生成,而非外部攻击者注入。既有工作中的 LLM 记忆审计器 MemMorph 仅将传播率从 71% 降至 34%。我们公开这些场景,以支持针对这一新兴威胁的防御评估。
