论文
用户会察觉吗?针对工具使用型大语言模型智能体的隐蔽间接提示注入攻击
Will the User Ever Know? Covert Indirect Prompt Injection Attacks on Tool-Using LLM Agents
摘要
随着 LLM 代理通过工具采取实际行动,间接提示注入 (IPI) 已成为严重威胁。标准指标攻击成功率 (ASR) 计算注入是否成功,但忽略用户在代理的最终响应中注意到的内容。查看成功的注入跟踪,我们发现两个不同的结果:代理在返回正常响应的同时执行注入,或者在其最终响应中报告注入的操作,让用户有机会注意到。我们将这些称为隐蔽的成功和公开的成功。从用户的角度来看,我们将 ASR 分解为隐蔽成功率 (CSR)(计算最终响应中不留痕迹的成功次数)和显性成功率 (OSR)(计算用户可以检测到的成功次数)。为了了解造成差距的原因,我们分析了成功的轨迹,发现代理在注入后的行为将隐蔽与公开分开:隐蔽跟踪在结束之前将手控制权返回到用户任务,而公开跟踪则在攻击本身结束。这种划分遵循 ReAct 格式,其中最终响应总结了最近的操作。基于这一观察,我们提出了 ICoA(诱导隐蔽攻击),这是一种 IPI 攻击,旨在通过在执行注入后将代理引导回用户任务来诱导隐蔽结果。在 AgentDojo 的四个目标模型中,ICoA 实现了最高的 CSR,比最强基线提高了 3.79-12.01 个百分点。
