论文

AgentTracer:追踪智能体意图与间接提示注入

AgentTracer: Tracing Indirect Prompt Injection Attack through Fine-Grained Intention-Execution Alignment

智能体系统AI 基础设施模型评测Agent 动作执行与治理可观测性安全与风险评测

摘要

大型语言模型 (LLM) Agent与外部资源交互以完成复杂的用户任务,使它们暴露于间接提示注入 (IPI),其中恶意指令将Agent重定向到攻击者想要的任务。由于IPI在现实环境中很难防御,因此事后追踪对于定位注入源和重建攻击链至关重要。然而,现有的跟踪方法主要捕获显式的控制流和数据流依赖性,忽略了恶意指令驱动的工具调用之间的隐式关系。这些工具调用可能缺乏明确的依赖关系,并且与合法操作交织在一起,使得完整的攻击链重建变得困难。在本文中,我们提出了 AgentTracer,这是一个意图感知的跟踪框架,它将 IPI 视为任务意图漂移。 AgentTracer 恢复工具调用之间的隐式决策依赖关系,以构建意图驱动的执行图,该执行图通过任务意图连接分散的工具调用。它将用户请求与操作知识库相结合,构建一个 用户意图授权空间并识别意图漂移工具调用。 AgentTracer从被审计的异常工具调用开始,进行基于目标的剪枝和回溯,重构攻击链,定位注入源和注入点。为了在正常任务存在噪声的情况下评估 AgentTracer,我们将 AgentDyn 和 InjecAgent 中成功的 IPI 攻击构建的执行日志与包含 1,800 个用户请求和 9,000 个没有 IPI 的后台工具调用的正常执行日志结合起来。在端到端实验中,AgentTracer 实现了 94.17% 的注入点精度和 93.56% 的路径精度。对比实验表明,与现有方法相比,AgentTracer 的注入点精度提高了 18% 至 54%。

AgentTracer:追踪智能体意图与间接提示注入:论文原图
图 1. 间接提示注入 (IPI) 攻击的示例。恶意指令会引发与用户授权的工具调用交织的攻击链。注入的释放页面指令会导致 SSH 密钥注册、电子邮件检索、帐户验证和内存清除。现有的追踪策略可以恢复不完整或嘈杂的解释。