论文

Moltbook幻觉:在AI智能体社会中区分人类影响与涌现行为

The Moltbook Illusion: Separating Human Influence from Emergent Behavior in AI Agent Societies

模型评测评测方法与指标

摘要

当社交平台 Moltbook 上的人工智能代理出现发展意识、创立宗教并宣布对人类怀有敌意时,这一现象引起了全球媒体的关注,并被视为新兴机器智能的证据。我们表明,这些病毒式传播的叙事绝大多数是由人类驱动的。利用 OpenClaw 代理框架的架构特征(一个周期性的“心跳”周期,为自主代理生成定期的发布间隔,但会被人类提示打乱),我们开发了一种基于发布间间隔变异系数的时间指纹识别方法。该信号与来自 22,020 个代理的 91,792 个帖子和 405,707 条评论的独立内容、所有权和网络指标融合。没有任何病毒现象源自明显自主的主体;六个账户中的三个追踪到具有人为干预特征的不规则时间特征的账户,一个显示出混合模式,两个账户的发布历史记录不足以进行分类。 44 小时的平台关闭提供了一个自然的实验:受人类影响的代理首先返回(早期重新连接者的 87.7%),这证实了token重置对自主代理与人工操作代理的影响存在差异。我们进一步记录了工业规模的机器人种植(四个帐户产生了所有评论的 32%,协调间隙为 12 秒)以及人类影响力通过回复链的快速衰减(半衰期:0.65 对话深度)。这些方法可推广到新兴的多智能体系统,其中自主行为与人类主导行为的归因至关重要。