论文
人工审议群体的智慧
The Wisdom of Artificial Deliberative Crowds
摘要
大量外行估计的聚合往往优于个体专家判断,这一现象被称为群体智慧。虽然这通常归因于估计的独立性,但审议会带来更强的效应:对小规模审议群体的共识估计取平均,优于经典的群体智慧,且个体判断在审议后本身也变得更准确。这些改进能否迁移到彼此审议的大语言模型尚不清楚。我们将此前用于人类被试的三阶段审议范式适配到来自三个不同家族的大语言模型,并在四个现实风险递增的领域进行测试:视觉数值估计(研究1)、机器学习论文同行评审(研究2)、检测AI Agent的隐藏恶意行为(研究3),以及针对真实预测市场的体育预测(研究4)。跨领域来看,审议在独立回答的被动聚合之外降低了集体误差,且审议后的个体判断保留了这一集体收益。值得注意的是,这一优势依赖模型多样性:由单一模型克隆组成的群体无法从审议中获益。这些结果确立机器审议为一种通用的聚合机制,并指出多样性是关键活性成分。