论文
自主多代理系统中的欺骗和通信:我们之间的实验研究
Deception and Communication in Autonomous Multi-Agent Systems: An Experimental Study with Among Us
摘要
由于 大语言模型 被部署为自主代理,它们的战略欺骗能力提出了多目标、多代理系统中的协调、可靠性和安全性的核心问题。我们通过“我们之中”这一合作竞争环境的社交演绎游戏来研究 L2LM 智能体的欺骗和沟通。在 1,100 个游戏中,自主代理生成了超过 100 万个会议对话词元。利用言语行为理论和人际欺骗理论,我们发现所有主体都主要依赖指令性语言,而冒名顶替主体则略微转向解释和否认等代表性行为。欺骗主要表现为模棱两可,而不是彻头彻尾的谎言,在社会压力下增加,但很少提高胜率。我们的贡献是对 LLM 智能体中角色条件欺骗行为的大规模分析,以及当前智能体偏好低风险模糊性的经验证据,这种模糊性在语言上微妙但在策略上受到限制,揭示了自主通信中真实性和实用性之间的根本张力。