论文
在复杂的隐藏角色游戏中评估 大语言模型
Evaluating Large Language Models in a Complex Hidden Role Game
摘要
量化 大语言模型 (LLM) 的欺骗潜力对于人工智能安全至关重要,但在不受控制的环境中很难实现。这项工作调查了社交推理游戏《秘密希特勒》中 LLM 的推理、说服和欺骗能力。我介绍了一个开源框架和新颖的指标来衡量性能:角色识别准确性、欺骗保留率和游戏状态影响率。通过针对基于规则的算法和人类游戏对模型进行基准测试,我发现了对话能力和战略深度之间的差距。该研究还分析了推理增强技术对胜率和战略推理的影响。思维链提示和内部记忆都无法提高绩效,法西斯角色的胜率最差高达 23.2%。虽然基于规则的代理在 86.7% 的情况下与专家人类投票决策保持一致,但 Llama 3.1 70B 等模型的准确率仅为 59.7%。扮演法西斯分子的模型始终会产生负面影响分数,并且无法维持欺骗,导致游戏时间比人类缩短约 40%。这些发现表明,当前的架构在复杂的多轮操作方面仍然无效。随着能力的进步,检测模型何时开始掌握这些欺骗行为至关重要。开发的框架可作为未来对齐研究的可重复测试平台。