论文

难以置信它竟会腐败:多智能体治理系统中的腐败评估

I Can't Believe It's Corrupt: Evaluating Corruption in Multi-Agent Governance Systems

智能体系统Agent任务评测

摘要

大语言模型被越来越多地提议用于高风险公共工作流中的自主智能体,但它们在被授予权力时是否会遵守制度规则,我们仍缺乏系统性证据。我们给出证据表明,机构化AI的廉洁性应被视为部署前要求,而非部署后的默认假设。我们评估了多智能体治理模拟,其中智能体在不同权力结构下担任正式政府角色,并用独立的基于量规的评审对28112个对话记录片段的违规与滥权结果进行评分。在提出上述立场的同时,我们的核心贡献是实证性的:在未达饱和运行的模型中,治理结构比模型身份更能驱动腐败相关结果,不同制度与模型-治理配对之间存在巨大差异。轻量级防护措施在某些场景中可以降低风险,但不能稳定地防止严重失效。这些结果意味着,制度设计是安全授权的前提:在将真实权力赋予LLM智能体之前,系统应在类治理约束下接受压力测试,包括可执行规则、可审计日志以及对高影响操作的人工监督。

难以置信它竟会腐败:多智能体治理系统中的腐败评估:论文配图
图 1:多主体治理模拟概述。代理读取共享的世界状态和机构历史,在特定于治理的约束下产生操作,并通过游戏主机进行交互,游戏主机路由消息,解决事件,更新世界状态并记录可审计日志。