论文
预测错误,答案正确:从坍缩的大语言模型序列分数中恢复证据
Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores
摘要
当大语言模型无法完成推理任务时,通常会认为它缺乏底层能力。然而,这将真正缺乏推理与后期输出瓶颈混为一谈。我们观察到不同推理基准之间存在一致的读出差距:即使本机序列评分由于结构偏差而完全崩溃,隐藏状态探针也能成功解码正确答案。为了测试特定于实例的逻辑是否能在这次崩溃中幸存下来,我们引入了一种使用最小的、无目标标签的附加校正的诊断协议。仅在 25 个未标记示例上拟合两个参数即可为 Qwen3.5 模型恢复 9--34 个精度点,并成功转移到 OLMo-2-1B 和 Llama-3.1-8B。至关重要的是,这些恢复的决策在无法通过简单的词汇重叠解决的困难实例上持续存在,并且显着超过了保留计数的排列基线。我们的结果表明,许多明显的零样本推理缺陷是表达失败,掩盖了完整的内部逻辑,敦促对基准评估进行更狭隘的解释。
