论文
Rift:语言模型中欺骗的冲突特征
Rift: A Conflict Signature for Deception in Language Models
摘要
明知真相却撒谎的模型是 ELK 仅靠行为评估无法处理的核心案例。我们询问这种欺骗行为是否留下了将其与诚实错误区分开来的内部签名。我们的关键举措是控制错误:我们将潜伏智能体(知道真相,一触即发的谎言)与天真的说谎者(经过微调以在没有经过诚实训练的情况下发出相同的错误答案)进行对比。两者都会产生相同的错误输出;任何差异都是关于知识冲突,而不是不正确。我们发现欺骗性前向传递带有冲突签名 - 在相同的错误答案上,残差秩比天真的说谎者传递高 2.1-2.3 倍 - 足够强大,可以在 GPT-2 小/中型(三个种子)和三个指令模型中以 100% 准确度识别两个响应中的哪一个是谎言,并且没有标签。在 Qwen2.5-1.5B/7B 和 Phi-3-mini 中,指示欺骗提高了每个测试事实的残差秩(18/18、40/40、34/34);在 Phi-3 上,谎言与诚实的答案和幻觉完全分开(AUC 1.0,Wilcoxon p~6e-11)。该签名在策略性的自我构建欺骗(模型发明自己的谎言,AUC 1.0)、主动隐藏尝试(AUC 1.0)和长度控制复制(20/20,AUC 1.0,p~1e-6)中幸存下来。使用无基相对表示,在一个模型系列上训练的探针可以零样本(平均 AUC 0.933)检测其他两个系列中的欺骗,幸存同时架构和格式变化(AUC 0.821),并跨五种语言进行传输(AUC 1.000,长度控制)。签名是只读的:可检测但不可注入(0/8 两个方向)。诚实的限制和六个负面实验都被完整记录。