论文

多智能体人工智能安全作为一个制度设计问题

Multi-Agent AI Safety as an Institutional Design Problem

模型评测智能体系统Agent 协作安全与风险评测

摘要

人工智能代理越来越多地在系统内工作,这些系统控制着它们如何委派任务、移动信息、执行操作和使用共享资源。最近的工作已经表明,部署规则可以改变集体行为。在这里,我们询问人工智能机构的哪些部分提供安全性以及它们如何做到这一点。这是 POLIS 的第一篇论文,POLIS 是一个正在进行的研究项目,研究多智能体系统的算法机构。我们报告了一个冻结的 5,280 集学习套件。主要的预先指定的委托实验涵盖四个模型系列;有针对性的高冲突诊断增加了三个额外的模型端点。在匹配的结构化工作流程中,模型会看到不同的规则制定,并且警卫会咨询不同的权限状态。我们还改变了立即合规的内部/自我回退的吸引力,并允许阻塞的工作流程继续进行。详细的宪法提示产生 0/384 已实现的违规行为。来源感知的可执行防护也会产生 0/384,尽管它会阻止 51/384 集中的禁止尝试;其中 44/51 的剧集后来安全完成。地方国家警卫的失败集中在普通转型改变可见政策而原始权力保持不变的情况下。在匹配的洗钱场景中,该警卫在 22/96 次事件中承认违规,在 0/96 次事件中承认来源执法 (p = 4.77 x 10^-7)。一项单独的资源分配实验表明,揭示其他方面相同的上限的数值会改变代理请求。在这些结构化工作流程中,相同的最终违规率可能隐藏着截然不同的机制。规则本身只是制度的一部分。系统信任的权威声明很重要,区块后可用的路径也是如此。