论文

ORBIT:联合测试多Agent的攻击、防御与架构

ORBIT: A Framework for Multi-Agent Safety and Security Evaluations

模型评测安全与风险评测

摘要

多Agent LLM系统越来越多地用于复杂长时程任务,或随着Agent在实际环境中交互自然出现。它们也带来明显安全风险:支持任务泛化的灵活协议暴露级联提示注入和Agent串谋等新威胁。缺少共享实证基础设施拖慢防御进展,每种新防御都要专门构建环境,无法标准比较。现有评测只涉及孤立威胁模型或单Agent,没有在真实多Agent环境中联合变化攻击、防御和架构。我们提出ORBIT,一个基于英国AISI Inspect、可配置的多Agent安全评测框架。研究者可以配置通信拓扑、记忆、调度和Agent角色。它支持四类威胁、四种防御,以及非对抗失败;基准覆盖浏览器、计算机使用、Agentic编程、客服和协同资源分配五类场景。核心发现是防御跨威胁迁移存在缺口:在多问题编程中使被攻陷Agent攻击成功率降低60个百分点的逐动作防御,对串谋Agent没有可测保护;没有一种受测防御对全部受测攻击泛化。我们还展示安全与表现的取舍,以及架构和防御效果的相互作用。ORBIT已开源。 https://github.com/wlanderson0/orbit