论文
推理模型中的"洞见"错觉
The Illusion of Insight in Reasoning Models
摘要
推理模型有"啊哈!"时刻吗?先前的工作表明,像DeepSeek-R1-Zero这样的模型会经历突然的推理中途顿悟,从而产生准确的输出,暗示其具备内在的自我修正能力。然而,这种推理策略的内在转变是否真的能提升表现仍不清楚。本文研究推理中途的转变,并对训练过程进行监测以检测它们。我们的分析覆盖超过100万条推理轨迹、数百个训练检查点、三个推理领域,以及多种解码温度和模型架构。我们发现,推理转变很罕见,不会随训练变得更频繁,也很少提升准确率,这表明它们与先前对模型洞见的认知并不相符。然而,它们的影响随模型不确定性而变化。基于这一发现,我们证明在高熵下人为触发外在转变能可靠地提升准确率。我们的结果表明,推理中途的转变是不稳定推理行为的症状,而不是一种内在的自我修正机制。
