论文

学风格、忘语义:SFT与RFT的分类任务案例

Learning Style, Forgetting Semantics: A Case Study of SFT and RFT on Classification Tasks

模型训练监督微调与指令调优

摘要

为什么监督微调(SFT)比强化微调(RFT)遗忘更多,即使所有教师演示在语义上都正确?我们在分类任务上研究该问题:每个语义类内的token以不同风格表达同一语义答案。任务共享底层语义规则,但提示分布与教师风格偏好不同。用可解的线性softmax策略,我们把更新精确分解为语义与风格分量,并证明在共同策略与提示下,SFT与RFT的语义更新平行但风格动力学不同:从类内无风格偏好的策略出发,精确策略梯度的RFT保持这种对称,而带非均匀教师的SFT在总体更新下沿非零任务均值发展出轴外风格漂移。我们用该漂移在显式条件下建立分离:对来自共同完美拟合检查点的总体更新,SFT遗忘在有限训练区间上存在严格正下界,而RFT保持零语义误差。任务序列上的仿真支持这些理论预测。