论文

植入、潜伏、触发:针对大语言模型智能体的休眠攻击

Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents

模型评测上下文与知识智能体系统记忆Agent Skills安全与风险评测Agent记忆

摘要

大语言模型(LLM)智能体仍然容易受到来自外部环境的安全威胁:攻击者将对抗性内容注入工具返回数据、网页或MCP上下文等外部观察中,引发不安全操作或错误输出等有害智能体行为。现有研究通常聚焦单次交互攻击,即智能体观察到对抗性内容并在一次用户请求内立即表现出有害行为。然而,我们表明对抗性内容还能在同一个智能体服务的多次交互之间持续存在,使此类威胁更难检测与缓解。具体而言,对抗性内容可能存留于智能体状态中,在各次交互间保持休眠,随后被一个良性的用户查询激活。我们将这类安全威胁形式化为休眠攻击(Sleeper Attack)。为评估它,我们构建了一个包含1896个实例的基准,覆盖六种真实世界有害后果、三种攻击策略和三类智能体状态目标:会话上下文、记忆和可复用技能。在七个强大的开源与闭源LLM上的实验表明,最先进的LLM智能体对休眠攻击依然脆弱,即便它们在单次交互基线下攻击成功率很低。我们的代码与数据发布于 https://anonymous.4open.science/r/skdvnfu23ihr9wdscnksf1asdffsaef。

植入、潜伏、触发:针对大语言模型智能体的休眠攻击:论文配图
图 1:直接单交互攻击和 Sleeper 攻击之间的比较。在直接的单交互攻击中,会注入对抗性内容并在同一用户请求中触发有害的代理行为。在潜伏者攻击中,对抗性内容被植入并存储在代理状态中,在交互过程中保持休眠状态,并在稍后由良性用户请求触发。