论文

真相从未消失:兼容上下文真相探测中的完美混叠

The Truth Was Never Gone: Perfect Aliasing in Compliant-Context Truth Probes

模型评测模型行为与机制分析

摘要

在真实报告和任务规定的行动相一致的情况下安装的真相探测器无法仅将这些目标与其合适的标签区分开来。我们将这种语义识别失败称为完美别名。在受控的二进制报告游戏中,安装在合规上下文上的真相和规定动作探针解决了相同的优化问题。在竞争环境中,它们的标签是互补的,迫使它们的 AUROC 总和为 1;该恒等式在 751 个单元层对中保持浮点精度。我们使用随机码本将规定的输出符号与语义动作分开,然后通过拟合混合的兼容和竞争上下文将真理与规定的动作分开。对于在所有评估的竞争对手试验中给出错误答案的奖励训练 Gemma-2-9B 策略,传统探针在三个训练种子中得分为 0.006 美元\pm 0.005$ AUROC,而混合拟合探针在相同的保留激活中得分为 1.000 美元。混合拟合使用更多的训练示例并访问标记的竞争上下文,因此这种比较建立了线性可恢复性,而不是隔离去相关的好处。我们还表明,两个完美分布的顺应拟合探针在相同的竞争对手激活中得分分别为 0.080 美元和 0.986 美元。这些发现涉及探测器测量的内容:它们没有建立保留的功能信念、恢复方向的因果使用或可部署的欺骗探测器。代码和汇总结果附在本文中。