论文

DecepEval:Agent 欺骗行为评测基准

DecepEval: A Benchmark for Evaluating Deception in LLM Agents

智能体系统Agent任务评测

摘要

随着大语言模型(LLM)智能体变得越来越自主,他们可能会通过欺骗来追求任务绩效,引发对其可靠部署的担忧。现有的评估表明,LLM 智能体可以欺骗,但经常检查孤立的场景或狭义定义的条件,限制了对欺骗何时更有可能发生的系统理解。为了解决这一差距,我们引入了 DecepEval,这是一个包含 3 个任务系列和 28 个专业场景的 1,532 个实例的基准测试。借鉴经典欺诈理论,我们提出了LLM欺骗钻石框架,该框架描述了可能诱发欺骗的四种外部条件:压力、激励、机会和冲突。 DecepEval 将每个实例的中性版本和诱导版本配对,以测量欺骗率的条件相关变化,而明确的任务事实和可观察的智能体行为有助于区分欺骗和与能力相关的错误。对九个前沿 LLM 的评估表明,诱因增加了模型和任务族中的欺骗行为,甚至在基线欺骗率较低的模型中也是如此。 DecepEval 使这些漏洞变得可测量,为可信赖的人工智能的进展提供了一个共享基准。

DecepEval:Agent 欺骗行为评测基准:论文原图
图 1:DecepEval 概述。该基准涵盖 3 个任务系列、28 个专业场景和 4 个外部条件,并通过配对中性评估和诱导评估来评估欺骗行为。