论文
PlanFlip:经规划阶段提示注入攻击多智能体LLM系统
PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection
摘要
多智能体LLM系统日益依赖规划器(Planner)把目标分解为子任务序列,由下游执行者与批评者执行和审计。我们识别出规划阶段是一个关键攻击面:向规划器上下文注入一次即可实现级联放大,同时污染所有下游子任务。我们提出PlanFlip框架,包含四种规划阶段提示注入攻击——目标替换(PF-1)、优先级倒置(PF-2)、上下文污染(PF-3)与角色混淆(PF-4)——各自伪装成合理的工具输出以躲避关键词过滤。对九个前沿LLM、3,479个回合的评估揭示三点:(1)能力放大脆弱性——GPT-5取得最高攻击成功率(ASR=0.68),与“更强模型天然更安全”的假设相悖;(2)同质流水线存在关联智能体盲区——GPT-4o与Llama-3.3-70B的ASR接近0,但隐蔽性达1.00、StepShift大于0:攻击重构了计划而同底座的批评者却报告一致(两名独立裁判确认-0.20至-0.32的语义偏差,r=0.943);(3)推理增强模型能抵抗注入——DeepSeek-R1在所有攻击下StepShift=0.00。我们提出GoalAnchorCheck(D1)与CrossAgentConsensus(D2),检测率最高达1.00,在16格中的15格优于同底座基线。核心洞见:异构模型多样性是多智能体系统的安全前提;同质底座内的冗余对规划阶段攻击不提供保护。
