论文
ICON:基于推理时纠正的智能体间接提示注入防御
ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction
摘要
大语言模型(LLM)智能体容易受到间接提示注入(IPI)攻击,即检索内容中的恶意指令劫持智能体的执行。现有防御通常依赖严格的过滤或拒绝机制,存在一个关键局限:过度拒绝,过早终止有效的智能体工作流。我们提出 ICON,一个从探测到缓解的框架,在中和攻击的同时保持任务连续性。我们的关键洞见是,IPI 攻击会在潜在空间中留下独特的过度聚焦签名。我们引入 Latent Space Trace Prober,基于高强度得分检测攻击。随后,Mitigating Rectifier 执行外科手术式的注意力导向,选择性地操纵对抗性查询-键依赖,同时放大任务相关元素,以恢复 LLM 的功能轨迹。在多个骨干上的大量评估显示,ICON 取得有竞争力的 0.4% ASR(攻击成功率),比肩商用级检测器,同时带来超过 50% 的任务效用增益。此外,ICON 展现出稳健的分布外(OOD)泛化,并有效扩展到多模态智能体,在安全与效率之间建立了更优平衡。
