论文

FoE:错误之森使首个解成为大推理模型的最佳解

FoE: Forest of Errors Makes the First Solution the Best in Large Reasoning Models

模型推理推理验证与自校正

摘要

以DeepSeek-R1为代表的近期大推理模型(LRM)在复杂推理任务上取得显著成功,在探索多个备选解时表现出类人模式。然而细察之下,我们揭示了一个惊人现象:“首个即最佳”(The First is The Best):备选解不仅次优,还可能有害。这一观察挑战了广为接受的测试时扩展律,使我们提出假设:推理路径中的错误随测试时间同步增长。通过全面的实证分析,我们将错误刻画为森林结构的错误之森(Forest of Errors,FoE),并得出FoE使首个解成为最佳解的结论,该结论有严谨的理论分析支撑。基于这些洞见,我们提出RED,一个自引导的高效推理框架,包含两个组件:I)Refining First,抑制首个解中FoE的增长;II)Discarding Subs,通过双一致性修剪后续FoE。跨五个基准、六个骨干模型的大量实验表明,RED优于八个竞争基线,性能提升最高达19.0%,同时将token消耗降低37.7%~70.4%。此外,围绕FoE指标的对比实验阐明了RED何以实现有效性。

FoE:错误之森使首个解成为大推理模型的最佳解:论文配图
图1:上半部分展示「首个即最优」,下半部分为错误森林(FoE)结构,使大推理模型的首个解成为最优解。