论文

在可操作之前可读:间接即时注入的因果追踪

Readable Before Actionable: Causal Tracing of Indirect Prompt Injection

模型评测安全与风险评测

摘要

间接提示注入导致LLM智能体遵循嵌入在外部数据中的命令。 探针可以区分指令和数据,而不识别改变下一个动作的状态编辑。我们通过反事实角色探针、按组件激活修补以及对 AgentDojo 轨迹的单独干预来研究这一差距。角色解码在内容和格式的变化中仍然存在。在受控的 Qwen 测试中,它先于沿着独立估计的角色方向的补丁产生强烈的工具选择效果。在 AgentDojo 上,根据被劫持和抵抗的训练轨迹估计的方向会降低预行动和注入跨度位置的攻击成功率,但在随机位置几乎没有影响。在较长的 Qwen 轨迹中,单位置编辑在后面的层中变得不太有效;跨度范围内的重复编辑会降低同一评估集上的攻击成功率。删除学习的通道子空间可以保留角色解码,但有效的干预方向在测试通道之间的传递效果很差。这些发现将可读的角色信号与有效的行为干预区分开来:深度在受控工具选择中很重要,而位置和背景在攻击轨迹中也很重要。