论文

GFT:从模仿到奖励微调——无偏群体优势与动态系数校正

GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification

模型训练强化学习

摘要

大语言模型通常采用监督微调(SFT)与强化学习(RL)进行后训练,但有效统一高效知识注入与稳健泛化仍具挑战。本工作提供了训练动力学分析,表明SFT可解释为策略梯度优化的一个特例——其隐式奖励极端稀疏且逆概率加权不稳定,二者共同导致单路径依赖、熵坍缩与梯度爆炸。受这一诊断启发,我们提出Group Fine-Tuning(GFT),一个统一的后训练框架,通过两种机制克服上述内在局限:Group Advantage Learning构建多样化响应组并推导归一化对比监督以缓解奖励稀疏;Dynamic Coefficient Rectification自适应地约束逆概率权重以稳定优化,同时保持高效的知识注入。实验表明,GFT持续超越基于SFT的方法,且所得策略能与后续RL训练更平滑地衔接。

GFT:从模仿到奖励微调——无偏群体优势与动态系数校正:论文配图
图 1:Qwen2.5-Math-1.5B 在 Numina-Math 上的性能。 (a) 相对于基本模型的准确度变化:SFT 持续降低性能,凸显灾难性遗忘。 (b) 不同训练管道的准确性:SFT+GRPO 管道的协同作用较差,单独的 GRPO 表现不佳。