骆驼会说话吗?保护多智能体系统免受间接提示注入攻击
Can CaMeLs Talk? Securing Multi-Agent Systems Against Indirect Prompt Injection Attacks
摘要
间接提示注入攻击(嵌入在大语言模型处理的内容中的恶意指令)仍然是安全部署使用智能体工具的主要障碍。 CaMeL [Debenedetti et al., 2025] 通过将受信任的控制流与不受信任的数据分离并在运行时强制执行基于功能的安全性策略,减轻了个体智能体的威胁。在这项工作中,我们研究了 CaMeL 的安全保证是否包含在分层多智能体系统中,其中智能体调用其他智能体作为工具。我们发现CaMeL 的保证并不成立。我们构建了一个具体的即时注入攻击,尽管所有组成部分智能体都单独运行 CaMeL,但该攻击仍然成功。我们的攻击利用了这样一个事实:不可信数据可以被下游智能体重新解释为可信输入。然后,我们引入了 multi-CaMeL,这是一种智能体到智能体的通信协议,它通过将可信自然语言指令与通过不同数据通道传递的不可信数据分开来跨智能体边界保留来源。我们在 AssetOpsBench 上评估多 CaMeL 的实用性,并在 MultiAgentDojo 上评估其安全实用性权衡,MultiAgentDojo 是我们通过将 AgentDojo 扩展到多智能体设置而开发的基准。我们发现,多 CaMeL 将攻击成功率 (ASR) 降低至 0.0%,而单独智能体 CaMeL 的攻击成功率 (ASR) 为 0.2%,无 CaMeL 的攻击成功率 (ASR) 为 12.9%。 Multi-CaMeL 会产生效用成本,但随着模型能力的增加,该成本呈下降趋势,并且对于最强的模型来说是适度的,这表明能力更强的模型可以更好地适应协议施加的约束。