论文

有界Agent:多Agent AI系统的委托安全

Bounded Agents: Delegation Security for Multi-Agent AI Systems

智能体系统Agent 动作执行与治理Agent Harness

摘要

基于LLM的Agent可以代表用户访问云服务、调用工具或调用其他Agent。在会话开始时,Agent的权限被设定但保持静态,每个请求被独立评估,而不考虑先前的动作。在其权限范围内,Agent可能做出与受托任务相悖的行为,把各自被允许的动作组合成被禁止的结果,或者不设限制地把权限委托给子Agent。提示注入只有在Agent拥有执行此类行为的权限时才构成风险;因此这是一个授权架构问题,而不仅仅是模型问题。Agentic Principal Chain(APC)逐级跟踪从一个主体到下一个主体的委托授权。APC使用六项授权检查,对照累积的会话状态评估每个请求。APC承接并收紧被委托的范围与预算。借助组合闭包,APC对照先前的动作检查请求以阻止被禁止的组合,并在模型之外强制执行决策。我们为APC实现证明了爆炸半径单调性与组合可靠性;组合可靠性限于在完整限制集与串行准入下的被禁止组合。我们评估了3,154个实例,包括InjecAgent、AgentDojo和ASB。受损模型评估通过在第一个合法工具调用之后插入金标准攻击调用,独立于模型行为测试APC。AgentDojo的数据外泄在所有四个域中从75-100%降至0%;APC拦截了InjecAgent全部544个数据窃取案例。意图绑定把破坏行为从38.6%降至4.0%,把操纵行为从90.5%降至12.1%。在空闲主机上,授权延迟第99百分位为0.24毫秒;在949个AgentDojo任务注入对上,两种设置下的效用分别下降8.6和13.9个百分点。实现、评估工具与数据均已公开。