论文

推理模型中的"洞见"错觉

The Illusion of Insight in Reasoning Models

模型评测模型行为与机制分析

摘要

推理模型有"啊哈!"时刻吗?先前的工作表明,像DeepSeek-R1-Zero这样的模型会经历突然的推理中途顿悟,从而产生准确的输出,暗示其具备内在的自我修正能力。然而,这种推理策略的内在转变是否真的能提升表现仍不清楚。本文研究推理中途的转变,并对训练过程进行监测以检测它们。我们的分析覆盖超过100万条推理轨迹、数百个训练检查点、三个推理领域,以及多种解码温度和模型架构。我们发现,推理转变很罕见,不会随训练变得更频繁,也很少提升准确率,这表明它们与先前对模型洞见的认知并不相符。然而,它们的影响随模型不确定性而变化。基于这一发现,我们证明在高熵下人为触发外在转变能可靠地提升准确率。我们的结果表明,推理中途的转变是不稳定推理行为的症状,而不是一种内在的自我修正机制。

推理模型中的"洞见"错觉 配图
图 4:Qwen2.5–1.5B 的正式“Aha!”事件发生率(所有领域,T=0.7)。每个单元格显示在先验失败阈值(δ₁)与先验稳定性阈值(δ₂)取不同值、且 δ₃=ε>0 的条件下,满足定义 3.1 的问题-检查点对 (q_j, k) 的比例(及数量)。即使在宽松的设定下,正式“Aha!”事件也极为罕见。更详细的热力图计算理解指南见附录 C.1。分领域与分温度的细分结果见附录 D.3。