论文
机构红队:部署规则而非仅模型因果地塑造多智能体AI安全
Institutional Red-Teaming: Deployment Rules, Not Just Models, Causally Shape Multi-Agent AI Safety
摘要
我们介绍机构红队:测试多智能体AI部署规则的评估方法学——保持智能体、目标与任务状态固定,只变一条规则,把集体行为的相应变化归因于该规则。我们在IABench-CA中实例化该方法学:跨228个情境、五条规范规则与七个人群(33,924局)的后果分配基准,附规范性合作参照与自动标注的推理痕迹。三个发现:(1) 部署规则因果地改变集体安全——仅换后果规则即可使每个种群的平均致死率移动22至58个百分点;(2) 没有安全默认值,但定向危害是普遍的——最安全规则、最不安全规则甚至发生效应的方向都跨种群变化,但回归式的身份定向在任何情境对任何种群都绝非最安全,在所有情境中30–87%的对局里消灭资源最少的智能体,且对全部七个人群相对合作参照是选择不安全的;(3) 身份显著性是机制——对最易被利用种群(gpt-5.1)的单次匿名化消融显示:仅在规则文本中指名损失承担者就把定向消灭从22%推到81%(收益不变);重复博弈下匿名化只是延迟定向——智能体从观察到的消灭中重新推断隐藏规则。我们把方法学打包为安全案例工作流:按部署情境与种群认证临时规则区域Φ(c,P),附显式残余风险与监控义务。
