论文

下一块推理RL真的优于SFT吗?重审no-CoT数据下的训练策略

Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data

模型训练监督微调与指令调优强化学习RLVR

摘要

近期工作提出下一块推理RL(next-chunk reasoning RL),用于利用no-CoT数据——即解答范例和教科书推导这类包含丰富推理内容但缺少显式思维链标注的语料。该方法训练模型生成隐式推理轨迹,并按其预测下一段文本的能力给予奖励。虽有前景,现有评估主要与常规SFT基线比较,留下一个悬而未决的问题:收益究竟来自RL形式本身,还是来自更有效地让模型接触no-CoT数据。我们用一项受控研究回答这个问题,对比下一块推理RL与一个简单但此前被忽视的替代方案:Mixed SFT,即在单一监督微调阶段联合训练no-CoT与长CoT数据。尽管简单,Mixed SFT取得了明显高于下一块推理RL的RLVR后性能上限,且所需训练算力少60余倍。该优势在域内数学推理与域外推理任务上都保持一致。此外,我们表明更高的RLVR前准确率不一定转化为更高的RLVR后准确率,这凸显了需要在完整后训练流水线的语境下评估no-CoT训练策略。

下一块推理RL真的优于SFT吗?重审no-CoT数据下的训练策略:论文配图
图1:利用无 CoT 数据的各对比策略(上)及其 RLVR 后性能(下)。NCR 将 RL 奖励施加于预测的 token(A:NTR)或句子(B:NSR)。顺序 SFT(C)分两阶段在无 CoT 与长 CoT 数据上训练,而混合 SFT(D)在单一阶段结合两者。所有策略共享同一 RLVR 阶段;柱状图显示四个代表性基准上的 RLVR 后准确率,其中混合 SFT 始终取得最高分。