论文
DEFER1:多 Agent 安全中的规则与判断边界
Where Rules End and Judges Begin: Measuring the Judgment Boundary in Multi-Agent Systems Security
摘要
基于 LLM 的多智能体系统 (MAS) 使用工具、共享记忆并委派任务,经常遇到对抗性内容。当前的 MAS 防御通常是孤立评估的,一次只关注一种攻击类型,这可能会导致成本高昂且难以审计的结果。这项研究将防御分为五项原则,并将其实施为 DEFER1(确定性优先执行与剩余判断),其中包括 28 项级联检查,阻止其所能阻止的内容,并将其余部分提交给由四名法官组成的小组。在跨四个域的独立测试中,攻击成功率从约 30.0% 下降至约 3.0%,其中 78% 的被阻止攻击是通过确定性检查处理的。只有四分之一的提案到达了安全运营领域的法官手中,这表明这些规则为违反明确策略的攻击提供了安全保障,而法官则管理那些仅歪曲意图的攻击。这两个系统都存在弱点,例如风险评分批准门不能准确批准大多数攻击建议,但很少批准合法的攻击建议,这凸显了准确评估威胁的挑战。
