论文
IterInject:通过反馈引导的迭代优化针对 LLM 代理进行间接提示注入
IterInject: Indirect Prompt Injection Against LLM Agents via Feedback-Guided Iterative Optimization
摘要
基于 LLM 的代理越来越多地部署用于需要规划、工具使用以及与外部服务交互的复杂任务。他们对不受信任的外部内容的依赖使他们面临间接提示注入(IPI),其中将对抗性指令嵌入到检索到的数据劫持代理行为中。现有的攻击依赖于静态有效负载,无法适应特定于代理的防御;即使是最近的自适应方法也缺乏结构化反馈来指导优化。我们引入了 \oursys,一个反馈引导的迭代框架,它关闭了注入、诊断和细化之间的循环:基于规则的诊断器生成带有行为描述的结构化结果标签,并且基于 LLM 的优化器根据完整的优化历史细化有效负载。综合步骤从失败模式中生成新的伪装种子,使策略空间能够自我进化。在 AgentDojo 和 InjectAgent 上,\oursys 在四个受害者模型中的性能大大优于静态基线和现有的自适应方法。 Claude Code(具有分层防御的生产级 编码智能体)的扩展实验表明,优化的有效载荷在 9 个目标中的 5 个上取得了完全成功;即使那些抵制充分利用的人也通过迭代细化表现出了可衡量的改进。我们进一步对 IPI 进行了机制分析,确定了中后期层中注意力介导的阈值机制;三种因果干预措施验证了这一发现并指出了具体的防御方向。