论文
自发欺骗与指令驱动欺骗中的不对称性
Asymmetries in Spontaneous and Instructed Deception
摘要
大语言模型有时会在未经指示的情况下欺骗用户。然而,许多关于模型欺骗的研究都涉及指导性欺骗。我们研究了 Llama-3.1-70B-Instruct 中受指导和自发(无指导)欺骗之间的关系。我们通过方向几何、交叉设置分类器和交叉设置转向来比较这两种欺骗设置。我们发现这两种欺骗设置共享一个方向分量(余弦约为 0.5),并且检测和因果关系设置之间的传递不对称。自发训练的分类器在指示数据上的表现优于反之亦然,而受指示的派生方向在引导自发提示方面的表现优于反之亦然。同样,导出引导向量的最佳标记位置不同于训练和应用分类器的最佳标记位置。
