多代理系统中分布式安全的软标签治理
Soft-Label Governance for Distributional Safety in Multi-Agent Systems
摘要
多智能体人工智能系统表现出任何单个智能体单独产生的涌现风险。现有的安全框架依赖于代理行为的二元分类,抛弃了基于代理的评估中固有的不确定性。我们引入了 SWARM(\textbf{S}ystem-\textbf{W}ide \textbf{A}ssessment of \textbf{M}ulti-agent systems),这是一个模拟框架,用 \emph{soft probabilistic labels} $p = P(v{=}+1) \in [0,1]$ 替换二进制好/坏标签,从而实现连续值收益计算、毒性测量和治理干预。 SWARM 实现了一个具有可配置杠杆(交易税、断路器、声誉衰减和随机审计)的模块化治理引擎,并通过概率指标量化其影响,包括预期毒性 $\mathbb{E}[1{-}p \mid \text{accepted}]$ 和质量差距 $\mathbb{E}[p \mid \text{accepted}] - \mathbb{E}[p \mid \text{rejected}]$。在五种子复制的七个场景中,严格的治理使福利降低了 40% 以上,而没有提高安全性。与此同时,积极内部化系统外部性使总福利从 $+262$ 的基线下降到 $-67$,而毒性保持不变。断路器需要仔细校准;过度限制的阈值会严重降低系统价值,而最佳阈值则可以平衡适度福利与最小化毒性。配套实验表明,软指标通过通过传统二进制评估的自我优化代理来检测代理游戏。此基本治理层适用于 LLM 支持的实时代理(Concordia 实体、Claude、GPT-4o Mini),无需修改。结果表明,分布式安全需要\emph{连续}的风险指标,而治理杠杆校准涉及可量化的安全与福利权衡。源代码和项目资源可在 https://www.swarm-ai.org/ 上公开获取。