论文

SoK:在智能体AI时代重新思考越狱攻击:攻击、防御及实践考量

SoK: Rethinking Jailbreaking in the Era of Agentic AI: Attacks, Defenses, and Practical Consideration

模型评测上下文与知识记忆安全与风险评测Agent记忆

摘要

大语言模型(LLMs)正迅速从对话助手演变为能够推理、规划、调用工具、维持持久记忆、与其他智能体通信并执行多步任务的智能体AI系统。与此同时,现代模型在原生安全对齐方面显著强于以往世代,而许多早期的越狱攻击与防御研究正是基于这些旧模型。这一转变引发一个根本性问题:哪些已建立的越狱安全结论在现代LLM和智能体AI时代仍然成立?我们通过知识系统化(SoK)方法,将越狱安全问题重新定义为围绕完整智能体执行流程的分析框架。我们构建了涵盖用户交互、规划与推理、记忆、工具使用以及智能体间通信等环节的统一攻击与防御分类体系,并提出一个安全-实用性-效率评估框架,将原生有害提示安全、对抗性越狱鲁棒性以及智能体层级安全结果进行解耦。我们进一步在通用智能体框架内对代表性攻击与防御进行了受控实验研究。结果揭示三个关键缺口:第一,强原生对齐并不意味着对对抗性越狱攻击具有鲁棒性;第二,防御效果高度依赖模型、攻击方式及组件,且可能带来显著的过度拒绝增加、实用性下降和延迟增加;第三,最终响应的低攻击成功率可能掩盖中间环节的严重安全漏洞:即使最终响应被成功过滤,规划、记忆和工具交互仍可能处于不安全状态。这些发现推动安全防御从以响应为中心转向跨层、执行感知的安全机制,该机制需保护智能体状态、组件转换及外部行为,同时保持实际可用性与效率。