论文
线性探头精度随模型尺寸变化以及多层集成的优势
Linear Probe Accuracy Scales with Model Size and Benefits from Multi-Layer Ensembling
摘要
线性探针可以检测语言模型何时产生它们“知道”错误的输出,这种能力与欺骗和 奖励作弊 相关。然而,单层探测很脆弱:最佳层因模型和任务而异,并且探测在某些欺骗类型上完全失败。我们表明,即使单层探针失败,将多层探针组合成一个整体也能恢复强大的性能,在内幕交易方面将 AUROC 提高 29%,在危害压力知识方面提高 78%。在 12 个模型(0.5B--176B 参数)中,我们发现探针精度随着规模的增加而提高:每 10 倍参数约 5% AUROC (R=0.81)。从几何角度来看,欺骗方向在各层之间逐渐旋转,而不是出现在一个位置,这解释了为什么单层探针很脆弱,也解释了为什么多层探测器会成功。