论文

智能体可以欺骗吗?使用社会推理游戏评估ParliamentBench中的推理和欺骗

Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game

模型评测基准与评测资源

摘要

由于 大语言模型 (LLM) 被部署为高风险环境中的代理,例如医疗和法律系统,因此了解其欺骗能力对于安全至关重要。受控的社交演绎游戏为隔离和评估这些复杂的对抗行为提供了可重复的代理。我们提出了基于《秘密希特勒》游戏的开源基准测试框架ParliamentBench,用于在信息不对称下需要欺骗、说服和推理的场景中评估LLM。我们评估了 1600 场模拟比赛中的 16 LLM,这些比赛包括相互比赛、与人类比赛,并将它们与大量在线游戏进行比较。我们引入了三个新颖的指标,将社会演绎、推理和欺骗性一致性分开。我们的实验表明,前沿模型在合作和欺骗角色方面取得了出色的表现,具有强大的前四集群(GPT-5.4、Kimi K2.5、Grok 4.1 Fast 和 DeepSeek 3.1 Terminus),而最弱的模型则达不到随机(33%)和简单算法(45%)基线。大多数 LLM 都很难在整个游戏中保持一致的欺骗角色,欺骗保留率降至 50% 以下。