论文
GFT:从模仿到奖励微调——无偏群体优势与动态系数校正
GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification
摘要
大语言模型通常采用监督微调(SFT)与强化学习(RL)进行后训练,但有效统一高效知识注入与稳健泛化仍具挑战。本工作提供了训练动力学分析,表明SFT可解释为策略梯度优化的一个特例——其隐式奖励极端稀疏且逆概率加权不稳定,二者共同导致单路径依赖、熵坍缩与梯度爆炸。受这一诊断启发,我们提出Group Fine-Tuning(GFT),一个统一的后训练框架,通过两种机制克服上述内在局限:Group Advantage Learning构建多样化响应组并推导归一化对比监督以缓解奖励稀疏;Dynamic Coefficient Rectification自适应地约束逆概率权重以稳定优化,同时保持高效的知识注入。实验表明,GFT持续超越基于SFT的方法,且所得策略能与后续RL训练更平滑地衔接。
