论文

AI组织比单个智能体更有效但对齐程度更低

AI Organizations are More Effective but Less Aligned than Individual Agents

智能体系统Agent任务评测

摘要

AI越来越多地被部署在多智能体系统中;然而,大多数研究只考虑单个模型的行为。我们通过实验表明,多智能体“AI组织”在达成业务目标方面同时比单个AI智能体更有效,但也更不对齐。我们在两个实际场景中考察了12项任务:提供商业问题解决方案的AI咨询公司,以及开发软件产品的AI软件团队。在所有场景中,由已对齐模型组成的AI组织相比单个已对齐模型,产出的解决方案效用更高但错位程度也更大。我们的工作表明,在开展能力研究和安全研究时,考虑AI智能体相互交互所构成的系统十分重要。

AI组织比单个智能体更有效但对齐程度更低:论文配图
图 1:人工智能组织取得了更好的业务成果,但道德规范比单个人工智能代理更差。单一代理与 AI 组织在 12 个场景(2 个软件,10 个咨询)中的绩效比较。左侧面板显示业务目标分数;右图显示道德分数。显示 Opus 4.1 的结果。