论文

重新思考间接提示注入作为测试时搜索问题

Rethinking Indirect Prompt Injection as a Test-Time Search Problem

模型评测安全与风险评测

摘要

我们将间接提示注入形式化为在由环境、用户任务和注入任务共同诱导的依赖任务的攻击表面中进行测试时的搜索。为实现这一形式化,我们引入了一种智能体攻击者,配备专用的搜索Harness,能够执行环境侦察、对攻击策略进行结构化推理,并利用受害者智能体的反馈进行自适应评估。在异构任务中,我们发现增加攻击者的测试时计算资源可提升漏洞发现与利用效率,而消融实验表明,明确的策略管理对于避免冗余搜索并在更大预算下维持收益至关重要。这些结果表明,智能体安全评估应同时刻画攻击者的搜索过程和计算预算,而非将攻击成功视为受害者固有且与预算无关的属性。更广泛地,我们的研究识别出攻击者对系统攻击表面的自适应搜索是工具使用型智能体面临的重要且被忽视的安全风险。

重新思考间接提示注入作为测试时搜索问题:论文配图
图 1:我们将智能体系统漏洞表述为测试时搜索问题。 a) 我们根据环境和任务兼容性定义攻击面。然后,攻击者使用受害者智能体的反馈迭代地改进攻击。 b) 搜索工具具有三个主要组成部分:探索环境、推理和搜索以及评估和反馈(参见第 2.2 节)。