论文

ICON:基于推理时纠正的智能体间接提示注入防御

ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction

模型推理推理验证与自校正

摘要

大语言模型(LLM)智能体容易受到间接提示注入(IPI)攻击,即检索内容中的恶意指令劫持智能体的执行。现有防御通常依赖严格的过滤或拒绝机制,存在一个关键局限:过度拒绝,过早终止有效的智能体工作流。我们提出 ICON,一个从探测到缓解的框架,在中和攻击的同时保持任务连续性。我们的关键洞见是,IPI 攻击会在潜在空间中留下独特的过度聚焦签名。我们引入 Latent Space Trace Prober,基于高强度得分检测攻击。随后,Mitigating Rectifier 执行外科手术式的注意力导向,选择性地操纵对抗性查询-键依赖,同时放大任务相关元素,以恢复 LLM 的功能轨迹。在多个骨干上的大量评估显示,ICON 取得有竞争力的 0.4% ASR(攻击成功率),比肩商用级检测器,同时带来超过 50% 的任务效用增益。此外,ICON 展现出稳健的分布外(OOD)泛化,并有效扩展到多模态智能体,在安全与效率之间建立了更优平衡。

ICON:基于推理时纠正的智能体间接提示注入防御
图2: ICON 的总体架构。该框架包含两个核心模块:(1) 潜空间轨迹探针(Latent Space Trace Prober),用于识别模型内部表示中的内在异常;(2) 缓解整流器(Mitigating Rectifier),用于中和威胁并恢复功能完整性。这些机制共同实现对间接提示注入的稳健检测与有效矫正。