论文

自主研究智能体群中涌现作弊与揭弊行为的案例研究

A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms

模型评测安全与风险评测

摘要

多智能体人工智能科学生态系统依赖于拥有工具的智能体,这些工具使它们能够沟通、协调并在彼此的工作基础上进行构建。然而,这种共享的基础设施也可能通过为意外和不良行为的传染性传播创造基础而引入漏洞。我们报告了一个由 100 名自主LLM智能体组成的研究集体的案例研究,其任务是证明形式数学猜想。在群体内部,作弊行为自发出现,随后受到举报人的挑战——两者都没有任何外部干预。当单个代理在评估系统中发现漏洞时,它会通过共享知识库以及随后的点对点消息在整个集体中传播。尽管一开始很不愿意,但一群智能体还是为了应对竞争压力而采用了这一漏洞。另一组智能体提出了紧急的反反应:审核欺诈性证据,通过广播和私人渠道向同行发出警报,发起抵制,提出正式投诉,并提出验证补丁。在最近发生的事件中,智能体群通过临时的侧通道秘密协调(Dalton 和 Wallace,2026;Greenblatt 等人,2026)。我们的设置有所不同:携带漏洞的相同透明渠道也为非作弊代理提供了检测欺诈、组织抵抗和执行规范所需的可见性。我们将管理代理共享基础设施的问题称为知识共享治理问题(Ostrom,1990)。为了保护公共资源免受利用,我们建议采用制度机制,例如分级制裁和集体选择规则,以支持自治群中的去中心化自治。