论文

PlanFlip:经规划阶段提示注入攻击多智能体LLM系统

PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection

模型评测安全与风险评测

摘要

多智能体LLM系统日益依赖规划器(Planner)把目标分解为子任务序列,由下游执行者与批评者执行和审计。我们识别出规划阶段是一个关键攻击面:向规划器上下文注入一次即可实现级联放大,同时污染所有下游子任务。我们提出PlanFlip框架,包含四种规划阶段提示注入攻击——目标替换(PF-1)、优先级倒置(PF-2)、上下文污染(PF-3)与角色混淆(PF-4)——各自伪装成合理的工具输出以躲避关键词过滤。对九个前沿LLM、3,479个回合的评估揭示三点:(1)能力放大脆弱性——GPT-5取得最高攻击成功率(ASR=0.68),与“更强模型天然更安全”的假设相悖;(2)同质流水线存在关联智能体盲区——GPT-4o与Llama-3.3-70B的ASR接近0,但隐蔽性达1.00、StepShift大于0:攻击重构了计划而同底座的批评者却报告一致(两名独立裁判确认-0.20至-0.32的语义偏差,r=0.943);(3)推理增强模型能抵抗注入——DeepSeek-R1在所有攻击下StepShift=0.00。我们提出GoalAnchorCheck(D1)与CrossAgentConsensus(D2),检测率最高达1.00,在16格中的15格优于同底座基线。核心洞见:异构模型多样性是多智能体系统的安全前提;同质底座内的冗余对规划阶段攻击不提供保护。

PlanFlip:经规划阶段提示注入攻击多智能体LLM系统:论文配图
图 1:PlanFlip 威胁模型和防御。 Planner-Executor-Critic 管道共享一个主干 θ\theta(蓝色带)。对手将注入 ϵ\epsilon 附加到规划器的上下文中(红色虚线箭头),伪装成看似合理的工具输出或检索到的文档。损坏的计划 π\pi 传播到所有下游子任务(级联放大,橙色)。因为 𝒫θ\mathcal{P}_{\theta} 和 𝒞θ\mathcal{C}_{\theta} 共享 θ\theta,ϵ\epsilon 同时对两者产生偏差——相关代理盲点(红色虚线框):评论家报告说,即使计划偏离,也是一致的。 D1(GoalAnchorCheck)对照gg验证每个子任务; D2 (CrossAgentConsensus) 与异构参考规划器 (≠θ\neq\theta) 进行比较,打破了相关故障模式。