论文

预测错误,答案正确:从坍缩的大语言模型序列分数中恢复证据

Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores

模型评测模型行为与机制分析

摘要

当大语言模型无法完成推理任务时,通常会认为它缺乏底层能力。然而,这将真正缺乏推理与后期输出瓶颈混为一谈。我们观察到不同推理基准之间存在一致的读出差距:即使本机序列评分由于结构偏差而完全崩溃,隐藏状态探针也能成功解码正确答案。为了测试特定于实例的逻辑是否能在这次崩溃中幸存下来,我们引入了一种使用最小的、无目标标签的附加校正的诊断协议。仅在 25 个未标记示例上拟合两个参数即可为 Qwen3.5 模型恢复 9--34 个精度点,并成功转移到 OLMo-2-1B 和 Llama-3.1-8B。至关重要的是,这些恢复的决策在无法通过简单的词汇重叠解决的困难实例上持续存在,并且显着超过了保留计数的排列基线。我们的结果表明,许多明显的零样本推理缺陷是表达失败,掩盖了完整的内部逻辑,敦促对基准评估进行更狭隘的解释。

预测错误,答案正确:从坍缩的大语言模型序列分数中恢复证据:论文配图
图1 分析失败的候选人回答分数。原始候选答题字符串评分可以选择错误的标签, 即使线性探测器从隐藏状态中解码黄金标签 。我们使用一种事先附加条件的添加剂(sy (x)sy (x)+bysy} (x)\mapsto sy}(x)+by})作为诊断性干预; 屏蔽式救援和变异控制测试, 校正是否暴露了具体实例的结构 。