论文
人工理性的谜团:研究大型推理模型中的产生-评估差距
An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models
摘要
对人类推理的研究表明,人们通常更擅长评估推理,而不是从头开始生成推理。相比之下,大型推理模型(LRM)经过训练,擅长产生长推理链来解决复杂问题。那么 LRM 在评估原因时表现如何?我们使用有效答案无效推理(VAIR)数据集对此进行研究:数学问题和解决方案具有微不足道的推理缺陷,但答案有效,旨在将推理评估与推理产生的混乱隔离开来。我们发现人类在评分方面只比解决此类问题差 6%,但与人类不同的是,我们发现 LRM 中的生产评估存在巨大差距:尽管解决方案生产近乎完美,但在评估 VAIR 解决方案时,前沿模型的得分低至 48%。为什么会有这个谜?通过思想链 (CoT) 分析,我们发现了答案确认偏差的证据:LRM 经常生成然后检查正确答案,而不是仔细验证每个步骤,甚至在注意到异常推理时也会编造合理化。线性探针证实了这一点,表明虽然 LRM 激活编码了有效推理的某些表示,但它们无法稳健地将 VAIR 解决方案表示为无效。最终答案表示的因果修补会导致 LRM 判决和激活翻转,这表明答案有效性是模型确认偏差的原因。这些发现表明,推理训练的主流方法存在显着的局限性,这会激励 LRM 产生并确认正确答案的推理,但不会稳健地评估根本原因。
