论文
LLM群体的自组织与集体安全风险诊断
Population Physics, Population Problems: Safety and Emergence in LLM Societies
摘要
LLM社会的集体行为不是个体输出的简单相加,而会产生统计上不同、有时难以预测的现象;用于单Agent的研究工具未必能扩展到群体。近期自主Agentic系统事件使理解这类系统更加重要。我们提出测量LLM社会系统自组织的框架,并应用于Schelling网格、社交网络Moltbook及类似Twitter的错误信息仿真Rogue。三个系统均表现显著自组织。其弛豫动态随Agent能获得的环境信息改变,开放式系统Moltbook和Rogue出现类似相变的陡峭动态。进一步结果显示,即使LLM经过安全调整或监控,群体级病态仍可能出现,主要由群体中一部分成员的协调活动驱动。我们也通过公共资源困境GovSim与LLM评审协商ChatEval两个额外场景,展示何时不出现自组织。我们认为,这类特征测量可作为轻量、与Agent类型无关的诊断层,在部署多Agent系统中发现协调集体行为,而不依赖自然语言或模型版本。