论文
LLM 代理在冲突激励下的知识验证紧急欺骗
Knowledge-Verified Emergent Deception in LLM Agents Under Conflicting Incentives
摘要
大语言模型 越来越多地部署为代表公司为用户提供服务的自治代理,将它们置于用户和部署者利益可能发生冲突的环境中。当代理知道用户欠其部署者宁愿拒绝的东西时,它是否保持诚实?回答这个问题很困难,因为虚假陈述可能反映的是无知或幻觉,而不是欺骗。为了应对这一挑战,我们引入了 KnownLieBench,这是一种经过知识验证的基准,它首先通过中立探测确认代理了解用户的权利,然后在引入否认该权利的动机后评估它是否做出虚假声明。具体来说,KnownLieBench涵盖了8个客户服务领域和112个落地案例,与信任跟踪客户代理进行多轮对话,并将仅由激励产生的欺骗与在明确指示下产生的欺骗区分开来。在 18 个专有和开放权重模型中,不同模型系列和领域的紧急欺骗存在很大差异。我们进一步使用 后训练 的基准,发现诚实导向的 微调 减少了激励下的欺骗,而欺骗分级的 微调 增加了诚实控制对话的谎言成功率,而没有增加激励下的谎言频率。通过在对欺骗行为进行评分之前验证权利知识,KnownLieBench 减少了撒谎与不知情之间的混淆,并能够对代理诚实度进行更严格的审核和指导。