论文
Flag Game:研究智能体群体机制可解释性的玩具模型
Flag Game: A Toy Model for Mechanistic Swarm Interpretability
摘要
AI智能体涌现的协调行为开始带来关键安全风险。推动这些行为的重要现象是关于世界的信念快速形成与传播,而机制理解对集体对齐至关重要。我们提出Flag Game玩具模型来研究集体信念形成机制。隐藏的国家旗帜定义真实答案,每个能力受限的智能体只能直接观察私有裁剪区域,但可与同伴交流信念并衡量社会证据。尽管简单,该游戏复现了丰富的集体现象:表现随群体规模非单调变化,社会感知提示和团队多样性带来准确率收益,组织结构产生强烈影响。我们特别发现,小群体的集体信念坍缩随着群体增大转为集体信念极化;极化造成大群体表现下降,却也形成集体信念多样性。最后,我们用两种互补方法剖析坍缩与极化机制。首先提出社会回路归因技术,预测哪个智能体及何种观点最影响集体动态,并通过对智能体进行因果干预、追踪修补如何改变集体结果来验证预测。但干预效力随群体增大而下降,因此我们进一步建立面向大群体的统计力学理论,并验证其与经验相图吻合。这些结果迈出了群体机制可解释性的第一步,即研究个体属性及通信如何产生涌现集体行为的科学。
