论文
BackdoorAgent:针对基于 LLM 智能体的后门攻击统一框架
BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents
摘要
大语言模型(LLM)智能体通过结合规划、记忆与工具使用的多步工作流执行任务。这种设计在带来自主性的同时,也扩大了后门威胁的攻击面。注入智能体工作流特定阶段的后门触发器可以在多个中间状态中持续存在,并对下游输出产生不利影响。然而,现有研究仍然零散,通常孤立地分析单个攻击向量,使得从以智能体为中心的视角来看,后门触发器的跨阶段交互与传播仍缺乏理解。为填补这一空白,我们提出 BackdoorAgent,一个模块化、阶段感知的框架,为 LLM 智能体中的后门威胁提供统一的、以智能体为中心的视角。BackdoorAgent 将攻击面结构化为智能体工作流的三个功能阶段,包括规划攻击、记忆攻击和工具使用攻击,并对智能体执行进行插桩,以系统分析触发器在不同阶段的激活与传播。基于该框架,我们构建了一个涵盖四个代表性智能体应用的标准化基准:Agent QA、Agent Code、Agent Web 和 Agent Drive,同时覆盖纯语言与多模态设置。我们的实证分析表明,在单一阶段植入的触发器可以跨多个步骤持续存在,并通过中间状态传播。例如,在使用基于 GPT 的骨干时,我们观察到触发器在 43.58% 的规划攻击、77.97% 的记忆攻击和 60.28% 的工具阶段攻击中持续存在,凸显了智能体工作流本身面对后门威胁的脆弱性。为促进可复现性与后续研究,我们的代码与基准已在 GitHub 公开。
