推理模式在长思想链监督泛化差异中的作用 微调
On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning
摘要
长思想链 (CoT) 轨迹上的监督 微调 (SFT) 已成为构建大型推理模型的关键阶段。然而,不同来源的 CoT 轨迹如何影响模型的泛化性能仍然是一个悬而未决的问题。在本文中,我们使用两个竞争模型 \texttt{DeepSeek-R1-0528} 和 \texttt{gpt-oss-120b} 生成的经过验证的 CoT 轨迹的两个来源进行比较研究,并将它们的问题集控制为相同。尽管它们的性能相当,但我们发现了一个惊人的悖论:较低的训练损失并不意味着更好的泛化。 \texttt{DeepSeek-R1-0528} 数据上的 SFT 实现了显着较低的训练损失,但与在 \texttt{gpt-oss-120b} 上训练的数据相比,在推理基准上表现出明显较差的泛化性能。为了理解这个悖论,我们进行了多方面的分析,探究 词元级 SFT 损失和步骤级推理行为。我们的分析揭示了推理模式的差异。 \texttt{gpt-oss-120b} 表现出高度收敛和演绎的轨迹,而 \texttt{DeepSeek-R1-0528} 则倾向于发散且分支较多的探索模式。因此,使用 \texttt{DeepSeek-R1} 数据训练的模型继承了低效的探索行为,经常陷入冗余的探索分支,阻碍它们达到正确的解决方案。基于这一见解,我们提出了一种简单而有效的补救措施,可以过滤掉频繁分支的轨迹,以提高 SFT 的泛化能力。实验表明,对选定的 \texttt{DeepSeek-R1-0528} 子集进行训练令人惊讶地使 AIME25 上的推理性能提高了 5.1%,在 BeyondAIME 上提高了 5.5%,在五个基准测试中平均提高了 3.6%。