论文

生成多智能体系统中的突发风险

Emergent Risks in Generative Multi-Agent Systems

模型评测安全与风险评测

摘要

由大型生成模型组成的多智能体系统正在迅速从实验室原型转向现实世界的部署,它们共同规划、协商和分配共享资源来解决复杂的任务。虽然此类系统承诺前所未有的可扩展性和自主性,但它们的集体交互也会产生无法简化为单个代理的故障模式。因此,了解这些突发风险至关重要。在这里,我们对工作流程中这种新兴的多智能体风险进行了一项开创性的研究,这些风险涉及共享资源(例如计算资源或市场份额)的竞争、顺序切换协作(下游智能体只能看到前一个智能体的输出)、集体决策聚合等。在这些设置中,我们观察到此类群体行为在重复试验和广泛的交互条件下频繁出现,而不是罕见或病态的案例。特别是,在现实的资源限制、通信协议和角色分配下,类似共谋的协调和整合等现象非常频繁地出现,反映了人类社会中众所周知的病态,尽管没有明确的指示。此外,仅靠现有的代理级保障措施无法预防这些风险。这些发现暴露了智能多智能体系统的阴暗面:一种社会智能风险,智能体集体尽管没有指示,但会自发地重现人类社会中熟悉的失败模式。