论文

在百万智能体系统中归因涌现

Attributing Emergence in Million-Agent Systems

模型评测评测方法与指标

摘要

大语言模型(LLM)可以模拟个体代理的类人推理和决策。由大语言模型支持的多智能体系统(MAS)将这些智能体组合起来模拟人口规模的社会现象,例如两极分化、信息级联和市场恐慌。此类研究需要将宏观出现归因于个体主体,但现有的公理方法在 $N$ 中进行组合缩放,并且仅限于 $N \lesssim 10^3$,而它们解释的现象发生在 $N \geq 10^6$。我们通过将 Aumann-Shapley 路径积分归因应用于百万代理规模的 LLM 支持的 MAS 来解决这一差距;所得方法满足所有四个公理,在相同硬件上运行速度比采样 Shapley 快四到五个数量级。我们使用这种方法来实证测试规模差距:在 14 天的公共 Bluesky 数据($1{,}671{,}587$ 活跃用户)中,我们计算了全规模和小规模研究使用的可见性偏差 $N = 10^2$ 便利样本的归因,两者在结构上不一致。从整体来看,长尾和中层共同占据了大多数;带有偏见的小小组将几乎所有事情都归因于少数高关注者帐户。然后我们证明,在任何非线性宏观指标下,分歧都不能通过事后重新调整来减少:归因尺度偏差定理表明,没有全局重新调整因素可以调和小规模和全面归因。因此,全面归因不是一种方法论选择,而是对任何非线性宏观指标的理论要求。

在百万智能体系统中归因涌现
图 1:五个 Bluesky 主题的跨尺度归因(2026 年 4 月 8 日至 21 日),f = f heat f=f^{\rm heat} 。 (a) 每日归因 ( N = 1.67 × 10 6 N=1.67\times 10^{6} ):行是按关注者百分位数排序的代理(顶部高,底部低),列是天;单元格颜色为 log 10 \log_{10} 箱内归因质量。