论文

SCALE:控制已学微调特征的强度,修正监督微调

Rethinking Token Reweighting for SFT: Suppress, Reverse, and Extrapolate Learned Features

模型训练监督微调与指令调优

摘要

监督微调(SFT)从模型认为最不可能的标记中最积极地学习。这有助于获得新的行为,但也会放大嘈杂或相互冲突的监督,并可能覆盖有用的预先训练的知识。通过统一的策略损失视图,我们重新审视现有的词元重新加权方法,并表明它们将非负系数分配给演示的词元。因此,它们可以抑制或放大监督更新,但无法逆转一旦学习到的有害特征。此外,较大的训练权重并不等于特征外推,因为它们改变了优化轨迹,而不是缩放固定的 SFT 方向。我们认为反转和外推需要一个由固定 SFT 增量定义的稳定参考系。受此启发,我们提出了 SCALE(通过局部熵选择性控制适应),这是一种熵引导的适应强度控制方法,它冻结预训练模型和 SFT 增量,并通过单独最小化预测熵来学习有界词元和模块特定的门。这些门根据其与熵减少的对齐来抑制、反转或推断冻结的 SFT 特征。在 Qwen2.5-Math-1.5B、Qwen2.5-Math-7B 和 Qwen3-4B-Base 中,SCALE 的数学推理平均值为 37.84、43.60 和 36.57,超过了最强的相应基线,同时在一般保留基准上保持竞争力。它还在所有三个模型的 HumanEval、HumanEval+ 和 MBPP 中实现了最佳平均代码生成性能。这些结果表明,有效的 SFT 校正可以通过控制已学习残差的使用方式而受益,而不仅仅是修改它们的学习方式。