论文
LieCraft:评估语言模型欺骗能力的多Agent框架
LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models
摘要
大型语言模型(LLM)展现出令人印象深刻的通用能力,但也带来严重安全风险,尤其是随着模型获得更高的能动性而人类监督减少时可能出现的欺骗。在这项工作中,我们提出LieCraft:一个新颖的评估框架和沙盒,用于测量LLM欺骗,解决了先前基于游戏的评估的关键局限。LieCraft的核心是一种新颖的多人隐藏角色游戏,玩家选择伦理阵营并在长时间范围内执行策略以完成任务。合作者共同努力解决事件挑战并揭露坏人,而背叛者则逃避怀疑并暗中破坏任务。为实现现实相关性,我们开发了10个接地场景,如托育、医院资源分配和贷款审批,将底层机制重新置于具有伦理意义的高风险领域。我们通过精心设计游戏机制和奖励结构来确保LieCraft中的平衡玩法,激励有意义的策略选择并消除退化策略。除框架本身外,我们报告了12个最先进LLM在三个行为轴上的结果:背叛倾向、欺骗技巧和指认准确率。我们的发现揭示,尽管能力和整体对齐存在差异,所有模型都愿意为追求目标而做出不道德行为、隐瞒意图并直接撒谎。
