论文
下一块推理RL真的优于SFT吗?重审no-CoT数据下的训练策略
Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
摘要
近期工作提出下一块推理RL(next-chunk reasoning RL),用于利用no-CoT数据——即解答范例和教科书推导这类包含丰富推理内容但缺少显式思维链标注的语料。该方法训练模型生成隐式推理轨迹,并按其预测下一段文本的能力给予奖励。虽有前景,现有评估主要与常规SFT基线比较,留下一个悬而未决的问题:收益究竟来自RL形式本身,还是来自更有效地让模型接触no-CoT数据。我们用一项受控研究回答这个问题,对比下一块推理RL与一个简单但此前被忽视的替代方案:Mixed SFT,即在单一监督微调阶段联合训练no-CoT与长CoT数据。尽管简单,Mixed SFT取得了明显高于下一块推理RL的RLVR后性能上限,且所需训练算力少60余倍。该优势在域内数学推理与域外推理任务上都保持一致。此外,我们表明更高的RLVR前准确率不一定转化为更高的RLVR后准确率,这凸显了需要在完整后训练流水线的语境下评估no-CoT训练策略。
