论文

从欺骗性输出到欺骗机制:语言模型欺骗研究的因果框架

From Deceptive Outputs to Deceptive Mechanisms: A Causal Framework for Language-Model Deception Research

模型评测模型行为与机制分析

摘要

关于语言模型欺骗的研究和新闻报道越来越多地将类似人类的心理状态概念归因于语言模型。此类主张可能会模糊看似具有欺骗性的行为与实际上具有欺骗性的机制之间的区别。我们引入了一种因果分类法,将先前的承诺与回顾性报告分开,将模型偏好与已实现的输出分开,将虚假偏好与对误导接收者的效用的敏感性分开,将欺骗行为与产生它的目标或策略的来源分开。我们在两个开放权重模型系列中测试了这些区别。在受控猜测游戏和股票交易实验中,我们发现,在没有相应的拟议机制的情况下,可能会出现欺骗性行为,而其他干预措施提供了直接证据,表明接收者信息状态可以因果影响欺骗性偏好。这些结果表明,欺骗行为可以为欺骗机制提供证据。但即使有证据证明这种机制存在,也无法在欺骗行为中树立典范。