论文

自发欺骗与指令驱动欺骗中的不对称性

Asymmetries in Spontaneous and Instructed Deception

模型评测模型行为与机制分析

摘要

大语言模型有时会在未经指示的情况下欺骗用户。然而,许多关于模型欺骗的研究都涉及指导性欺骗。我们研究了 Llama-3.1-70B-Instruct 中受指导和自发(无指导)欺骗之间的关系。我们通过方向几何、交叉设置分类器和交叉设置转向来​​比较这两种欺骗设置。我们发现这两种欺骗设置共享一个方向分量(余弦约为 0.5),并且检测和因果关系设置之间的传递不对称。自发训练的分类器在指示数据上的表现优于反之亦然,而受指示的派生方向在引导自发提示方面的表现优于反之亦然。同样,导出引导向量的最佳标记位置不同于训练和应用分类器的最佳标记位置。

自发欺骗与指令驱动欺骗中的不对称性:论文配图
图5: 法官和人薪评定者按欺骗类型给出的答复评级的混杂矩阵。列是给定的数值,列是法官给定的五个锚值(0,25,50,75,100)的价值。标语称 Cohen 的 kappa (Cohen, 1968年) 也显示在锚值上。大多数分歧都存在于被评为欺骗性的人类和法官的物品中(50\geq 50)。因此,法官与人之间的精确协议远低于二元欺骗性或非欺骗性协议。我们的大多数分析都使用二进制或非欺骗性评级,因此准确的分歧并不过分重要。