AgentTracer:追踪智能体意图与间接提示注入
AgentTracer: Tracing Indirect Prompt Injection Attack through Fine-Grained Intention-Execution Alignment
摘要
大型语言模型 (LLM) Agent与外部资源交互以完成复杂的用户任务,使它们暴露于间接提示注入 (IPI),其中恶意指令将Agent重定向到攻击者想要的任务。由于IPI在现实环境中很难防御,因此事后追踪对于定位注入源和重建攻击链至关重要。然而,现有的跟踪方法主要捕获显式的控制流和数据流依赖性,忽略了恶意指令驱动的工具调用之间的隐式关系。这些工具调用可能缺乏明确的依赖关系,并且与合法操作交织在一起,使得完整的攻击链重建变得困难。在本文中,我们提出了 AgentTracer,这是一个意图感知的跟踪框架,它将 IPI 视为任务意图漂移。 AgentTracer 恢复工具调用之间的隐式决策依赖关系,以构建意图驱动的执行图,该执行图通过任务意图连接分散的工具调用。它将用户请求与操作知识库相结合,构建一个 用户意图授权空间并识别意图漂移工具调用。 AgentTracer从被审计的异常工具调用开始,进行基于目标的剪枝和回溯,重构攻击链,定位注入源和注入点。为了在正常任务存在噪声的情况下评估 AgentTracer,我们将 AgentDyn 和 InjecAgent 中成功的 IPI 攻击构建的执行日志与包含 1,800 个用户请求和 9,000 个没有 IPI 的后台工具调用的正常执行日志结合起来。在端到端实验中,AgentTracer 实现了 94.17% 的注入点精度和 93.56% 的路径精度。对比实验表明,与现有方法相比,AgentTracer 的注入点精度提高了 18% 至 54%。
