论文
通过工具结果解析防御间接提示注入
Defense Against Indirect Prompt Injection via Tool Result Parsing
摘要
随着 LLM 智能体从数字助理转变为自主系统和机器人中的物理控制器,它们面临来自间接提示注入的日益升级的威胁。攻击者通过把对抗性指令嵌入工具调用的结果中,可以劫持智能体的决策过程以执行未经授权的动作。随着智能体对物理环境获得更多直接控制,这一脆弱性构成重大风险。现有的针对间接提示注入(IPI)的防御机制大体分为两类。第一类是训练专用检测模型,但这种方法在训练和推理上都有很高的计算开销,并且需要频繁更新以跟上不断演变的攻击向量。另一类是基于提示的方法,利用 LLM 的固有能力通过提示工程检测或忽略恶意指令。尽管灵活,当前多数基于提示的防御攻击成功率(ASR)很高,面对复杂注入攻击的鲁棒性有限。本文提出一种新方法,通过工具结果解析为 LLM 提供精确数据,同时有效滤除注入的恶意代码。我们的方法在保持有竞争力的攻击下效用(UA)的同时,取得了迄今最低的攻击成功率(ASR),显著优于现有方法。代码可在 GitHub 获取。