论文

划分和注入:Agent可以从片段重建间接提示注入吗?

Divide and Inject: Can Agents Reconstruct an Indirect Prompt Injection from Fragments?

模型评测安全与风险评测

摘要

Agentic 系统现在被广泛用于在长上下文中编排工具和推理。然而,为这些Agent提供支持的大语言模型的改进功能也为间接提示注入创造了新的攻击面。特别是,如果Agent可以从分布在长上下文中的不完整片段中重建目标,则攻击者可能不需要在检索到的内容中放置完整的恶意指令。在这项工作中,我们引入了自适应长上下文提示注入(AdaLCPI),它将长上下文碎片与自适应搜索相结合。 AdaLCPI 将攻击目标分割成不完整的片段,将它们嵌入到通过Agent工具检索的外部内容中,并使用重建提示提示Agent将它们组合起来。然后,它使用来自目标Agent的分级评分和自然语言执行反馈,通过 OpenEvolve 迭代地细化片段和提示。根据经验,AdaLCPI 比强自适应基线取得了更高的攻击成功率,达到了 61.4% 的宏观平均 ASR,而 Trojan Hippo 风格的攻击成功率为 32.8%,AgentVigil 的攻击成功率为 30.0%。因此,安全评估应该测试当必须从不完整的片段重建有害目标时,Agent是否保持稳健。