论文

SFT究竟应学习哪些Token?数学推理的Token裁剪视角

Which Tokens Should SFT Actually Learn? A Token-Trimming Perspective on Mathematical Reasoning

模型训练监督微调与指令调优

摘要

监督微调(SFT)对所有目标标记应用统一的交叉熵损失,即使不同的标记为数学推理提供了不平等的学习信号。这种统一的处理可能会过度锐化已经掌握的标记,同时放大不确定的、低置信度标记的学习压力,导致训练动态不佳。我们提出了 Trimmed Logit-Gap SFT (TrimSFT),这是一种简单的Token级别重新加权方法,可根据标准答案Token与其最强竞争对手之间的 logit 差距来缩放 SFT 损失。 TrimSFT 消除了两个极端的监督:已经掌握的标记(大的 logit 差距)和当前模型弱支持的标记(小或负的 logit 差距),将学习集中在它们之间的中间 logit 差距区域内。我们用以边际 m 为中心、带宽为 {\tau} 的高斯权重来实例化这一原理,不需要参考模型或额外的前向传递。我们在来自 Llama、Qwen 和 DeepMath 系列的六个基本模型上跨五个数学推理基准评估了 TrimSFT。 TrimSFT 持续改进标准 SFT,在六种模型中的五种上实现了最佳平均性能,在 MATH500 上比 SFT 提高了高达 +26.9 分。进一步的分析表明,带宽 τ 比精确的边缘位置更重要,而仅从一侧消除监督压力的半修剪变体会产生较差的权衡。Token级别的 logit-gap 分布分析表明,TrimSFT 以比统一 SFT 或单调重新加权方法更平衡的方式重塑模型置信度。这些结果表明,推理 SFT 可以受益于修剪两个极端,而不是统一处理所有标记。