论文
在策略参数更新方向是 LLM 训练后泛化的基础
On-Policy Parameter Update Direction Underlies Generalization in LLM Post-Training
摘要
on-policy训练后范式的强大泛化性能激发了对其参数更新行为的研究。然而,这些研究仅将观察到的行为视为策略训练中的副产品,忽视了它们作为优化原则来改进其他范式(例如监督微调(SFT))泛化的潜力。为了解决这个限制,我们调查是否存在可以实现此类改进的特定策略更新行为。首先,我们的分析表明,SFT 沿着一致的方向更新参数,而on-policy范式在训练过程中不断调整方向。这种差异激励我们将每个参数的累积更新方向作为一种有希望的行为来关注。然后,我们通过提出on-policy方向约束监督微调(OPSFT)来评估其提高泛化能力的有效性,OPSFT 将 SFT 更新限制为on-policy范式所确定的方向。 OPSFT 的强大性能表明,on-policy范式的泛化优势可以通过参数更新方向转移到 SFT。一旦确定了这样的方向,即使是 SFT 也可以将其更新限制在这个方向上进行概括。这一发现通过将在政策范式的强大泛化性与 SFT 的优势相结合,提供了两个实际好处,包括高训练效率和利用高质量轨迹的能力。为了提高效率,我们使用一些策略训练步骤来确定支持强泛化的更新方向,然后应用 OPSFT 来实现高训练效率。为了利用高质量的轨迹,OPSFT 可以利用这些轨迹沿着更新方向继续改进训练后模型,而不会破坏从on-policy训练中学到的能力。