论文

你的代理比你想象的更脆弱:揭示 Agentic LLM 中的间接注入漏洞

Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs

模型评测安全与风险评测

摘要

开源框架的快速部署极大地促进了现代多智能体系统的发展。然而,扩大的行动空间,包括不受控制的特权暴露和隐藏的系统间交互,带来了严峻的安全挑战。具体来说,间接提示注入 (IPI) 将恶意指令隐藏在第三方内容中,可能会在正常操作期间触发数据泄露等未经授权的操作。虽然当前的安全评估主要依赖于孤立的单轮基准,但这些代理在复杂的动态环境中的系统漏洞仍然没有得到充分的探索。为了弥补这一差距,我们系统地评估了跨九个 LLM 主干网针对四种复杂 IPI 攻击向量的六种防御策略。至关重要的是,我们完全在动态多步骤工具调用环境中进行评估,以捕获现代自主代理的真实攻击面。除了二元成功率之外,我们的多维分析揭示了明显的脆弱性。先进的注入成功地绕过了几乎所有的基线防御,一些表面级别的缓解措施甚至会产生适得其反的副作用。此外,虽然代理几乎立即执行恶意指令,但它们的内部状态表现出异常高的决策熵。出于这种潜在的犹豫,我们研究了表示工程(RepE)作为一种稳健的检测策略。通过提取工具输入位置的隐藏状态,我们发现基于 RepE 的断路器在代理提交之前成功识别和拦截未经授权的操作,从而在不同的 LLM 主干网中实现高检测精度。这项研究揭示了当前 IPI 防御的局限性,并为构建弹性多代理架构提供了高度实用的范例。