论文

反思性恢复:一种通过从错误中学习进行推理的自我监督方法

Reflective Recovery: A Self-Supervised Method for Reasoning by Learning from Mistakes

模型训练合成数据

摘要

数据驱动的微调由于其简单性和效率而被广泛采用来增强大型语言模型(LLM)中的推理。然而,完全依赖于完美推理轨迹的主流模仿学习方法会遭遇尺度崩溃:当问题集有限时,增加正面例子无法产生持续改进。然而,在推理过程中,LLM 无法保证每个中间步骤都是正确的,因此很容易出错。一旦出现此类错误,LLM往往很难挽回,并且可能会因为之前错误的积累而进一步被误导。为了解决这个问题,我们提出了反射恢复,这是一种简单而有效的自我监督方法,可以将失败的推理尝试转化为恢复训练数据。具体来说,我们提取失败轨迹的初始部分,将它们与提示连接起来,并使用它们来指导大语言模型找到有效的解决方案。由于失败轨迹中的这些片段可能包含错误,因此该过程教会模型在推理过程中识别和纠正错误,从而无需依赖外部批评者或奖励模型即可从错误状态中恢复。经过广泛的基准评估,反射恢复显着提高了性能。在 DeepSeek-R1-Distill-Qwen-7B 上,AIME 2025 的准确率从 30.0% 提高到 37.5%,Minerva 的准确率从 37.6% 提高到 47.8%。更重要的是,分析表明它打破了规模崩溃障碍,并使模型能够发展出紧急的自我纠正行为,代表着从以结果为导向的记忆到以过程为导向的反思推理的范式转变。