论文

相似的模型学得不同:预训练最终窗口在SFT之外塑造后训练

Similar Models Learn Differently: Final-Window Pretraining Shapes Post-Training Beyond SFT

模型训练预训练强化学习RLVR

摘要

开发者根据模型检查点的行为来评判它。在监督微调(supervised fine-tuning,SFT)之后,两个在相关基准上表现大致相同的检查点会被视为可互换的、同等准备好进入下一对齐阶段(通常是偏好优化)。我们追问这种评判是否遗漏了预训练的印记:一种任何SFT后基准都无法揭示、却决定每个检查点如何响应后续训练的差异。为弄清这一点,我们对预训练的最终窗口——即指令微调前最后训练的数据——进行了受控实验。六个分支从一个部分预训练的检查点分出,仅在这个窗口上不同:5亿token,占其前文token的0.1%到1%。每个分支在单一数据源上训练其窗口:通用网络文本、过滤后的网络文本、规范性话语、安全文本、数学文本或合成教育文本。随后的SFT与后训练完全相同。SFT之后各分支表现几乎一致,在指令遵循、拒答与能力上差距约在一个点以内;然而同样的后训练却把它们带到非常不同的终点,无论在直接偏好优化(direct preference optimization,DPO)更新下,还是在带可验证奖励的强化学习更新下都是如此。我们通过有害请求的拒答来度量这种偏离:后训练开始时,安全文本分支的拒答并不高于网络文本分支,但到结束时,它损失的拒答要少得多。其余四个分支几乎没有获得保护,因此该效应对窗口所含内容具有选择性。这种保护要求安全文本出现在预训练末尾而非更早,并且在第二个模型家族上可复现。模型预训练最后所学的内容塑造了它对对齐的反应。因此,不应仅凭SFT后的行为来评估检查点,还应随之一并报告其最后训练所用的数据。

相似的模型学得不同:预训练最终窗口在SFT之外塑造后训练:论文配图
图 12:语料库诊断。值越高意味着指定语料库特征的关键字命中率越高,但模型行为不一定越好。安全分支的特点是有害场景锚定和安全批评,而不仅仅是表面拒绝模板。 CdclmC_{\mathrm{dclm}} 作为 DCLM 对比度包含在内。