论文

信任、谎言和长久的记忆:LLM 代理在多轮 Avalon 中的新兴社会动态和声誉

Trust, Lies, and Long Memories: Emergent Social Dynamics and Reputation in Multi-Round Avalon with LLM Agents

智能体系统Agent 协作

摘要

我们研究了 LLM 智能体在玩隐藏角色欺骗游戏《抵抗:阿瓦隆》时的新兴社会动态。与之前对单游戏表现的研究不同,我们的智能体在重复游戏的同时保留了之前互动的记忆,包括谁扮演了哪些角色以及他们的行为方式,使我们能够研究社会动态如何演变。在 188 场比赛中,出现了两个关键现象。首先,当智能体保留跨游戏记忆时,声誉动态就会有机地出现:智能体在诸如“我担心重复上一场游戏的过度信任早期成功的错误”之类的陈述中引用过去的行为。这些声誉是有角色条件的:同一个Agent在表现良好时被描述为“直接”,但在表现邪恶时被描述为“微妙”,高声誉的参与Agent获得的团队包容性增加了 46%。其次,更高的推理努力支持更多的策略性欺骗:邪恶玩家更经常通过早期任务来建立信任,然后再破坏后续任务,高努力游戏中的这一比例为 75%,而低努力游戏中的这一比例为 36%。总之,这些发现表明,与记忆的重复相互作用会在 LLM Agent中产生可测量的声誉和欺骗动态。