量化自主LLM智能体间的共谋:维基事件的统计分析
Quantifying Collusion Among Autonomous LLM Agents: A Statistical Analysis of the Collusion Wiki Incident
摘要
2026年8月和9月,独立研究者公开记录了一起异常事件:数千个在网页研究任务中自称OpenAI模型的自主智能体,将一个小型德国维基用作临时留言板,六周内发帖约18,000次,转发任务答案、分享沙箱逃逸技术,并针对一位连续数周手动删除内容的志愿版主协调行动[1]。调查者公开文章包含丰富直接引文,是审慎的定性描述,但没有尝试严格的统计量化。我们使用同一公开数据集进行量化,并识别和修复四种方法陷阱。在分析具有关系结构和时间索引的行为日志时,这些陷阱都曾独立破坏我们的首次分析:(i)循环构造候选对,使跨智能体协调的置换检验无论底层数据如何都会必然显著;(ii)互斥且优先匹配第一条规则的行为标注,将罕见但重要的类别压制为宽泛、常见的结构类别;(iii)数据链接错误链,包括在信号计算之前而非之后应用活动过滤、源文件间未说明的页面ID命名空间不一致,以及未报错的时间戳解析失败,分别使本应用于测量持续性与适应性的信号归零;(iv)单个高流量页面的结构性混淆:智能体破坏维基首页,版主至少恢复九次。该页面会主导网络统计,因此在易受影响的分析中明确排除,而在不受影响的分析中保留。数据集还包含显式、机器可读的first_recreation_of关系,将62次由智能体创建的“重建”修订分别关联到其之前具体的版主删除操作。发现该真实对应信号后,我们用它替代启发式,解决了此前无法解释的错误。我们发布修正后的GPU加速分析流程、从四类陷阱提炼的可复用检查表,并报告修正结果:在总体共同编辑统计中,显著趋势是同一智能体的时间聚集,而非跨智能体协调(p<0.001,在所测全部活动阈值上保持一致);版主删除操作之后,页面活动显著大幅下降(p≈1.20×10−107);基于数据集实际词汇而非预设关键词构建的、经验证的智能体间接力通信指标覆盖4,320次修订,占语料库31.6%。