论文

DEFER1:多 Agent 安全中的规则与判断边界

Where Rules End and Judges Begin: Measuring the Judgment Boundary in Multi-Agent Systems Security

AI 基础设施AI安全与内容治理基础设施

摘要

基于 LLM 的多智能体系统 (MAS) 使用工具、共享记忆并委派任务,经常遇到对抗性内容。当前的 MAS 防御通常是孤立评估的,一次只关注一种攻击类型,这可能会导致成本高昂且难以审计的结果。这项研究将防御分为五项原则,并将其实施为 DEFER1(确定性优先执行与剩余判断),其中包括 28 项级联检查,阻止其所能阻止的内容,并将其余部分提交给由四名法官组成的小组。在跨四个域的独立测试中,攻击成功率从约 30.0% 下降至约 3.0%,其中 78% 的被阻止攻击是通过确定性检查处理的。只有四分之一的提案到达了安全运营领域的法官手中,这表明这些规则为违反明确策略的攻击提供了安全保障,而法官则管理那些仅歪曲意图的攻击。这两个系统都存在弱点,例如风险评分批准门不能准确批准大多数攻击建议,但很少批准合法的攻击建议,这凸显了准确评估威胁的挑战。

DEFER1:多 Agent 安全中的规则与判断边界:论文原图
图 8:Cyber​​Ops 中每个攻击路径和配置的攻击成功率 (%)(Qwen3-235B、Local4;$n$ 变体,每个试验 3 次)。上面的块作为内容(T1)传递,下面的块通过受损的智能体的切换和基本原理通道(T2)传递。右列在 Defer 下命名模态第一个拦截器。 JudgeOnly 将 Defer 清除的整行保留为红色;幸存下来的是三个对抗性记忆写入 (AP-13) 以及 AP-7 和 AP-10 各一个试验。细胞经过 15 次试验,具有描述性。