论文

思想链推理中的隐藏错误意识:信号是诊断性的,而不是因果性的

Hidden Error Awareness in Chain-of-Thought Reasoning: The Signal Is Diagnostic, Not Causal

模型评测模型行为与机制分析

摘要

思想链 (CoT) 提示假设生成的推理反映了模型的内部计算。我们以一种特定的、可测量的方式证明了这种假设是错误的:模型在内部检测到自己的推理错误,但在表面上表达了对它们的信心。隐藏状态上的线性探测从第一个推理步骤 (0.79) 开始预测迹线正确性为 0.95 AUROC,而错误迹线的口头置信度为 4.55/5,几乎与正确迹线相同 (4.87/5)。文本表面分类器在相同数据上仅达到 0.59,确认生成的文本中不可见的 0.20 点差距。这种隐藏的错误意识适用于三个模型系列(Qwen、Llama、Phi)、1.5B-72B 参数和 RL 训练的推理模型(DeepSeek-R1、0.852 AUROC)。自然的问题是这个信号是否可以修复它检测到的错误。它不能。四种干预措施——激活引导、探针引导的 N 次最佳、自我纠正和激活修补——全部失败;修补完全破坏了输出的一致性。该信号是诊断性的,而不是因果性的:计算质量的读数,而不是重定向它的杠杆。这描绘了机械可解释性的边界:推理过程中的错误表示与先前工作已成功编辑的事实知识表示根本不同。