论文
自我判断混杂下诊断正确性探针
Diagnosing Correctness Probes under Self-Judgement Confounding
摘要
隐藏状态读数可以预测语言模型输出是否正确,但客观正确性(OC)通常与模型自身的自我判断(SJ)一致,从而使解码信号在语义上模糊不清。我们构建了冲突案例,其中 OC 和 SJ 预测相反的读出顺序。对于高度置信度的分歧,传统的正确性标记对比通常将错误/自我认可的反应排在正确/自我拒绝的反应之上,遵循 SJ 而不是 OC。我们估计阶乘 SJ 和 OC 相关方向,并通过数学推理和事实回忆评估它们的极性。在多达 14B 参数的四个指令调整模型中,SJ 相关方向在每个模型的两个跨域方向上传递高于机会点,而 OC 相关方向在每个相应条件下对预期 OC 排序具有低于机会点估计。这种传输不对称性在中后期层中发展,在答案似然、序列长度和零方向控制下持续存在,并扩展到没有目标域方向拟合的 MMLU 和二进制 TruthfulQA。在所研究的模型和诊断子集中,最可靠的可转移组件保留了与 SJ 相关的极性。因此,仅可转移性并不能建立客观正确性语义。