论文
通过采样进行微调:SFT 比您想象的学得更好
Finetuning with Sampling: SFT Learns Better Than You Think
摘要
向前沿模型引入新功能长期以来一直是后训练的目标,为此主要采用监督微调(SFT)和强化学习(RL)。传统观点认为,强化学习能够在不失去现有能力的情况下对新任务进行强泛化,而 SFT 则容易出现弱泛化和灾难性遗忘。同时,SFT 可以从离策略专家数据中学习,而 RL 必须依赖模型通过重复采样找到成功轨迹的能力。在我们的工作中,我们寻求利用在政策学习的优势,同时利用离政策数据中包含的特权信息。然而,我们不是修改学习目标来适应这些数据,而是定制数据分布以更好地适应学习者。我们引入了马尔可夫链蒙特卡罗 (MCMC) 采样算法,在给定微调参考模型的情况下,该算法逐步将离策略轨迹转换为更加在策略轨迹。在科学技能获取、数学推理和开放式专业知识等任务中,我们的采样算法使 SFT 能够与流行的训练后技术相媲美,通常能够更好地概括,并且忘记的程度低于强大的政策基线。此外,由此产生的微调模型表现出强大的分布性能,并且能够在锐化基本模型分布之外进行学习。在更高的层面上,我们的方法将采样呈现为模型原生算子,它可以塑造数据以实现可学习性,并在整个训练后堆栈中作为通用原语提供更广泛的实用性。