论文
学习该学什么:小语言模型推理中 SFT-then-RL 的阶段特定数据集
Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning
摘要
后训练 用于推理的小语言模型 (SLM) 通常遵循 SFT-then-RL 管道,但现有工作很少考虑每个阶段应该学习哪些数据。我们认为,数据策略应该与 SFT 和 RL 的不同角色保持一致:SFT 更适合获取尚未掌握的推理技能,而 RL 更适合巩固模型已经部分掌握的技能。基于这一原则,我们提出了一种难度感知的 SFT-then-RL 框架,将训练数据组织成特定阶段的集合。对于 SFT 阶段的硬样本,我们引入了一种 Bridge 机制,将教师生成的原始推理轨迹转化为 SLM 更易于学习的监督。对于 RL 期间仍未解决的困难样本,我们应用 Critique 微调,将全零奖励故障转换为下一个 SFT 阶段的诊断、修复和新推理跟踪监督。在五个推理基准测试中对两个 SLM 进行的实验表明,我们的方法相对于代表性的 SFT、蒸馏 和 RL 基准持续改进。我们的结果强调了协调 SFT 和 RL 之间的数据难度对于有效的 SLM 推理 后训练 的重要性。