论文
RLVR 相对于 SFT 对于推理模型的可证明的优势:学习高效回溯
Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently
摘要
大语言模型 (LLM) 的最新进展表明,预训练基础模型的强化 微调 可以显着提高推理时的推理性能。在这项工作中,我们从理论上分析了为什么强化 微调 比纯监督 微调 (SFT) 方法具有更好的推理能力。我们将思想链 (CoT) 推理建模为图上的寻路问题,并将流行的强化学习与可验证奖励 (RLVR) 方法与传统的 SFT 进行比较。我们证明,当 SFT 在没有负例的标准最短路径上进行训练时,无法学习如何有效地回溯。相比之下,经过 RLVR 训练的模型可以学习如何仅使用结果奖励有效地从死胡同中回溯。这导致两种方法之间的推理时间计算呈指数分离,并表明 RLVR 引导模型学习推理链中困难决策的位置,最终允许更好地分配推理时间计算。最后,我们展示了 RLVR 模型的推理轨迹可以被提炼出来,以训练基本模型来有效地回溯。