论文

共识的掩盖:解开 LLM 正确性中的特权知识

Masked by Consensus: Disentangling Privileged Knowledge in LLM Correctness

模型评测模型行为与机制分析

摘要

人类通过外部观察者无法访问的私人内部状态进行内省来评估他们的理解。我们调查 大语言模型 是否拥有类似的有关答案正确性的特权知识,以及通过外部观察无法获得的信息。我们根据模型自身的隐藏状态和外部模型的问题表示来训练正确性分类器,测试自我表示是否提供性能优势。在标准评估中,我们没有发现任何优势:自探测的性能与对等模型探测相当。我们假设这是由于模型间答案正确性的高度一致性。为了隔离真正的特权知识,我们对分歧子集进行评估,其中模型产生相互矛盾的预测。在这里,我们发现了特定领域的特权知识:在事实知识任务中,自我表征始终优于同伴表征,但在数学推理中没有表现出优势。我们进一步将这种域不对称性跨模型层定位,发现事实优势从早期到中期层开始逐渐出现,与特定于模型的记忆检索一致,而数学推理在任何深度都没有显示出一致的优势。