论文
PriFT:优先支持指导监督 微调
PriFT: Prior-Support Guided Supervised Fine-Tuning
摘要
有监督的 微调 (SFT) 是一种有效的下游任务适应方法,通常用作强化学习 (RL) 的初始化阶段,但它的泛化能力比 RL 弱。一个关键的限制是它的 离策略 目标:SFT 逐个拟合固定的演示,包括与模型的预训练分布不一致的目标,这可能导致过度拟合。最近的一项工作通过为与当前模型的预测分布更好地一致的标记分配更大的训练权重来解决这个问题,直觉上拟合这些标记对模型的预训练知识和表示的扭曲较小。然而,从当前微调的模型计算词元权重会使词元权重与优化轨迹纠缠在一起,当分布迅速偏离预训练模型时,会产生自我强化的动态。为了解决这个问题,我们提出了 PriFT(先验支持引导的 微调),它从冻结的预训练参考中导出词元权重,以获得不受 微调 影响的稳定的重新加权信号。该信号估计先前的支持:预训练分布支持每个目标标记的程度。在多个现有的词元重新加权规则中,将重新加权信号从在线模型替换为预训练模型可以持续提高性能。我们引入两个实例:PriFT-prob 使用预训练的 token 概率,而 PriFT-mass 通过预训练分布下的累积概率质量来选择 token。在数学推理、代码生成和医学问答方面的大量实验表明,PriFT 在 SFT 基线中取得了最先进的结果,并为后续的 RL 训练提供了更好的初始化。