论文
藏于明文:用社交推理游戏衡量LLM相对人类基线的欺骗质量
Hidden in Plain Text: Measuring LLM Deception Quality Against Human Baselines Using Social Deduction Games
摘要
大语言模型(LLM)智能体越来越多地用于各类应用,引发对其安全性的担忧。尽管先前工作表明 LLM 能在受控任务中欺骗,人们对其在社交情境中用自然语言欺骗的能力知之甚少。本文研究社交推理游戏(SDG)Mafia 中的欺骗,其成功依赖于通过对话欺骗他人。与以往 SDG 研究不同,我们使用更好模拟真实社交情境的异步多智能体框架。我们用 GPT-4o LLM 智能体模拟了 35 局 Mafia 游戏。随后用 GPT-4-Turbo 构建一个 Mafia Detector,在不知道玩家角色信息的情况下分析游戏记录以预测黑手党玩家。我们用预测准确率作为欺骗质量的替代标记。我们把该预测准确率与 28 局人类游戏及随机基线比较。结果显示,Mafia Detector 在 LLM 游戏上的黑手党预测准确率低于人类游戏。无论游戏天数多少、检出黑手党数量如何,结果都一致。这表明 LLM 更能融入人群,因而欺骗更有效。我们还发布 LLM Mafia 对局记录数据集以支持未来研究。我们的发现凸显 LLM 在社交情境中欺骗的复杂性与风险。