论文

人工理性的谜团:研究大型推理模型中的产生-评估差距

An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models

模型评测模型行为与机制分析

摘要

对人类推理的研究表明,人们通常更擅长评估推理,而不是从头开始生成推理。相比之下,大型推理模型(LRM)经过训练,擅长产生长推理链来解决复杂问题。那么 LRM 在评估原因时表现如何?我们使用有效答案无效推理(VAIR)数据集对此进行研究:数学问题和解决方案具有微不足道的推理缺陷,但答案有效,旨在将推理评估与推理产生的混乱隔离开来。我们发现人类在评分方面只比解决此类问题差 6%,但与人类不同的是,我们发现 LRM 中的生产评估存在巨大差距:尽管解决方案生产近乎完美,但在评估 VAIR 解决方案时,前沿模型的得分低至 48%。为什么会有这个谜?通过思想链 (CoT) 分析,我们发现了答案确认偏差的证据:LRM 经常生成然后检查正确答案,而不是仔细验证每个步骤,甚至在注意到异常推理时也会编造合理化。线性探针证实了这一点,表明虽然 LRM 激活编码了有效推理的某些表示,但它们无法稳健地将 VAIR 解决方案表示为无效。最终答案表示的因果修补会导致 LRM 判决和激活翻转,这表明答案有效性是模型确认偏差的原因。这些发现表明,推理训练的主流方法存在显着的局限性,这会激励 LRM 产生并确认正确答案的推理,但不会稳健地评估根本原因。

人工理性的谜团:研究大型推理模型中的产生-评估差距:论文配图
图 5:答案确认偏差的 CoT 分析。每个评估器模型的 CoT 按其评估工作流程 (a-c) 和论证行为 (d,e) 进行分类。在 VAIR 解决方案中,LRM 经常 (a) 进行独立求解以确认有效答案,然后 (d) 通过盲目认可或强制合理化忽略有缺陷的推理步骤。 (b) IAIR 和 (c) VAVR 评估中保留了一些独立解决方案,但合理化在 (e) IAIR 评估中消失了。