论文

选择和改进:理解 后训练 的推理机制

Select and Improve: Understanding the Mechanics of Post-Training for Reasoning

模型评测模型行为与机制分析

摘要

强化学习已迅速成为推理和编码模型训练的关键组成部分,但从机械角度来看,人们对它的理解仍然很少。我们研究如何以及通过哪些底层流程通过强化学习 后训练 获得或增强能力。我们的分析基于 Qwen-2.5-1.5B 的受控数学推理实验,揭示了两个核心机制:策略选择和策略改进。我们的结果强调了 SFT 数据和强化学习数据在激活这些机制中的作用,特别是展示了监督不同推理策略的模型如何能够实现策略选择,以及强化学习数据的难度增加如何能够实现策略改进。总而言之,我们的结果提供了对强化学习训练的机制洞察,并提出了继续扩展推理能力的实际干预措施。