论文
探究推理性能的起源:RL与SFT微调模型在数学问题求解上的表征质量
Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models
摘要
越来越多的证据表明,通过强化学习(RL)训练的大型推理模型在数学推理任务上优于其监督微调(SFT)对应模型;然而这一优势的机理基础仍不清楚。因此我们追问:怎样的内部表征差异使RL模型表现更优?我们的工作给出两条相互印证的证据线:首先,在逐层隐藏态上训练的线性探针显示,RL模型在预测答案正确性方面往往比SFT模型达到更高准确率,表明其表征更具线性可分性与结构性。其次,均值消融研究表明,RL模型形成了更深层逐步变得更关键的层级架构,而SFT模型则将重要性均匀分布于各层。这些发现共同表明,RL训练从根本上重构了模型表征与处理推理问题的方式。最后,我们分析跨问题重复采样下的token数量变异,以评估自适应计算分配。虽然我们观察到某些RL微调模型比其SFT对应模型具有更高的变异性,但在另一些模型中看到很强的一致性,这表明token分配可能更多取决于整体训练流程,而非仅仅取决于RL还是SFT。我们认为这种token分配变异性揭示了合理的同策略推理的散布程度,凸显了哪些模型表现出稳定策略,而哪些模型表现出欠定、可能不可辨识的求解行为。
