论文

在冻结的大语言模型中定位答案正确性信号

Locating Answer-Correctness Signals in Frozen Large Language Models

模型评测模型行为与机制分析

摘要

语言模型公开了预测答案是否正确的内部信号,这些信号可以从冻结模型的单次前向传递中读取,而无需额外生成。然而,现有的探针通常致力于一个信号系列或信号层,并且在分布变化的情况下可能会变得脆弱;在检索增强设置中,许多专门的检测器改为以段落忠实度为目标,当检索到的证据无用或相互矛盾时,这可能会偏离正确性。因此,我们询问答案的正确性在哪里是可读的,哪些内部信号家族携带它,以及它们应该如何组合。我们搜索隐藏状态、标记概率、残余流特征、注意力及其融合,将选定的读数视为预测测量而不是机械定位。我们在闭卷和上下文设置中分别运行此分析,因为上下文可以改变哪些读数具有信息性。出现了一致的解剖结构:正确性集中在答案跨度中,即使在检索下也可以从答案标记中恢复,并且家族互补地携带它,因此融合它们有助于最大程度地摆脱单一信号最弱的分布。该协议在两个主干网中有效,并将检索控制器作为下游用途之一。