论文
记住定理,而不是实例:通过数学推理探索 SFT 泛化
Memorize Theorems, Not Instances: Probing SFT Generalization through Mathematical Reasoning
摘要
有监督的 微调 (SFT) 广泛用于特定任务的适应,但最近的工作表明它系统地破坏了推理泛化。我们认为根本原因不是记忆本身,而是其目标:普通的 SFT 驱动模型利用和记忆问题-解决方案对中的虚假表面相关性,从而使它们容易受到表面输入变化的影响。为了解决这个问题,我们提出了 Theorem-SFT,它通过教授模型如何调用规则而不是答案,将监督重新定位为明确的定理应用。 Theorem-SFT 在基准和模型系列中产生一致的增益:在 MATH (LLaMA3.2-3B-Instruct) 上 +8.8%,在 GeoQA (Qwen2.5-VL-7B-Instruct) 上 +20.27%,无需特定模态的重新训练。 微调 MLP 层单独匹配全层性能,暗示前馈组件作为推理规则的主要轨迹。我们的研究结果重新构建了争论:泛化失败并非源于记忆作为一种机制,而是源于记忆了错误的归纳目标。