论文
后训练不仅关乎词元:从状态分布理解SFT、RL与同策略蒸馏
Post-Training is About States, Not Tokens: A State Distribution View of SFT, RL, and On-Policy Distillation
摘要
大语言模型 后训练 方法,例如监督 微调 (SFT)、强化学习 (RL) 和 蒸馏,通常通过其损失函数进行分析:最大似然、策略梯度、前向 KL、反向 KL 或相关的目标级别变体。我们研究一个补充因素:实施监督的国家分布。对于自回归策略,状态是提示加上生成的前缀。 SFT 在固定数据集状态上进行训练,而 RL 和 同策略 蒸馏 (OPD) 在当前学习器引发的状态上进行训练。我们将 后训练 形式化为状态分布整形,并使用 Qwen3-0.6B-Base 在 GSM8K 上运行一项受控小规模研究,并使用 TruthfulQA 和 MMLU 作为保留评估。我们的结果显示了三种现象。首先,温和的 SFT 运行可以改善 GSM8K,几乎不会发生遗忘,而压力 SFT 运行会导致大量的保留损失。其次,尽管使用该教师作为唯一的监督源,但降级 SFT 教师的 OPD 在 GSM8K、TruthfulQA 和 MMLU 上超过了该教师。第三,轻量级 同策略 RL 运行改进了 GSM8K,同时保持了保留。这些结果支持 后训练 以状态为中心的观点:训练状态的来源和位置与监督信号的形式一样重要。