论文
对大语言模型测谎仪进行压力测试:角色扮演失败和虚假相关性
Stress-Testing LLM Lie Detectors: Role-Play Failures and Spurious Correlations
摘要
谎言检测探针旨在根据语言模型的内部状态预测其输出是真实的还是不诚实的。然而,角色扮演使大语言模型的“真相”含义变得复杂:语言模型可以采用各种角色,这些角色将截然不同的主张视为真实,包括其信念明显与现实相矛盾的角色,例如阴谋论者。在这项工作中,我们调查测谎探针是否可靠地标记在这种反事实角色下产生的谎言,或者它们是否遵循该角色的信念。我们引入了一个数据集,其中包含来自三位采用反事实角色的大语言模型的 8,916 个经过人工审核、符合政策的回复。通过评估之前工作中的八个探针,我们发现许多探针在此设置中失败,特别是在同一角色提示下评估正确和错误答案时。为了调查原因,我们构建了三个新颖的混杂数据集,其中真相与潜在的混杂概念反相关。我们的实验表明,许多现有的探针强烈跟踪与训练数据中的真实情况虚假相关的概念,例如指令合规性或响应可能性。基于这些发现,我们引入了一种简单的线性探针,它在角色压力测试和混杂因素压力测试中实现了最强的整体性能。我们的结果表明,当前的测谎探针远不可靠,并强调了对训练数据的需求,其中真相与混淆概念不相关。