论文

探针泛化作为 OOD 欺骗检测的子空间选择

Probe Generalization as Subspace Selection for OOD Deception Detection

模型评测评测方法与指标

摘要

线性探针可用于检测语言模型激活内的行为和概念,但可能无法转移到分布外的示例。当研究 Llama-3.1-8B-Instruct 探针在 3 个保留的欺骗检测数据集上的泛化性能时,我们发现将输入从激活的训练分布投影到主成分 (PC) 的一个小子集上可以实现跨域传输,几乎与直接在测试分布上训练的探针的性能相匹配。此外,我们发现 PC 解释可用于查找这些可转移 PC 的子集。通过使用 LLM 法官对每台 PC 的最活跃/最不活跃示例是否暗示可转移的欺骗方向进行评分,然后对得分最高的 PC 进行探测,我们在内幕交易报告上将基线与预言机的差距缩小了 78%,在沙袋上缩小了 25%。源探针权重很大的方向似乎对源特定的表面特征进行编码,而实际传输的方向似乎以自然语言描述可以捕获的方式更抽象地对相同的对比度进行编码。总的来说,我们的结果表明探针的 OOD 稳健性很大程度上取决于子空间选择。