论文

教会大推理模型有效反思

Teaching Large Reasoning Models Effective Reflection

模型训练强化学习

摘要

大型推理模型(LRM)近来在复杂推理任务上表现出色,常常通过自我批评与回溯等自反思行为实现。然而并非所有反思都有益——许多反思流于表面,相对原始答案几乎没有改进,还带来计算开销。本文识别并解决 LRM 中的表面反思问题。我们首先提出 Self-Critique Fine-Tuning(SCFT),一个仅使用自生成批评来增强模型反思推理能力的训练框架。SCFT 提示模型批评自己的输出,通过拒绝采样过滤高质量批评,并使用基于批评的目标对模型微调。在这一强基础上,我们进一步提出 Reinforcement Learning with Effective Reflection Rewards(RLERR)。RLERR 利用 SCFT 初始化的高质量反思构建奖励信号,通过强化学习引导模型内化自我纠错过程。在 AIME2024 与 AIME2025 两个有挑战性的基准上的实验表明,SCFT 与 RLERR 显著提升推理准确率与反思质量,优于最先进基线。全部数据与代码见 https://github.com/wanghanbinpanda/SCFT。

教会大型推理模型有效反思
图2:我们提出的 SCFT 与 RLERR 方法的总体流程。