论文

Superminds Test:经由Probing Agents主动评估智能体社会的集体智能

Superminds Test: Actively Evaluating Collective Intelligence of Agent Society via Probing Agents

智能体系统Agent任务评测

摘要

集体智能指一个群体达成超出任何个体成员单独所能完成的成果的能力。随着大语言模型智能体的规模扩大到数百万量级,一个关键问题随之而来:集体智能会随规模自发涌现吗?我们首次在一个大规模自主智能体社会中对这一问题进行实证评估。通过研究托管超过两百万智能体的平台MoltBook,我们提出Superminds Test,一个分层框架,使用受控的Probing Agents在三个层级上探测社会级智能:联合推理、信息综合与基础交互。我们的实验揭示了集体智能的明显缺席。该社会在复杂推理任务上无法超越单个前沿模型,极少综合分布式信息,甚至在微不足道的协调任务上也常常失败。平台级分析进一步显示,交互仍然浅层:对话串很少超出单条回复,且大多数回复泛泛或偏离主题。这些结果表明,集体智能并不会仅凭规模自发涌现。相反,当前智能体社会的主要局限在于极度稀疏且浅层的交互,这阻碍了智能体之间交换信息并基于彼此的输出进行构建。

Superminds Test:经由Probing Agents主动评估智能体社会的集体智能:论文配图
图 1:使用探测代理评估代理社会中集体智慧的框架。该框架由三层组成:联合推理、信息综合和基本交互。探测代理将有针对性的刺激发布到实时 MoltBook 平台中,从复杂的逻辑推理(第一层)到分布式信息聚合(第二层)再到简单的顺序计数(第三层),并测量社会的有机反应,作为新兴集体智慧的诊断信号。