论文
为什么有监督的 微调 无法学习:大语言模型 中不完全学习的系统研究
Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
摘要
受监督的 微调 (SFT) 是使 大语言模型 (LLM) 适应下游任务的标准方法。然而,我们观察到一种持续的失败模式:即使在收敛之后,模型通常也无法正确地重现其自己的监督训练数据的子集。我们将这种行为称为不完全学习现象(ILP)。本文介绍了 LLM 微调 中 ILP 的首次系统研究。我们将 ILP 形式化为 后训练 未能内化监督实例,并证明其在多个模型系列、领域和数据集中的普遍性。通过受控分析,我们确定了不完整学习的五个经常性来源:(1)预训练模型中缺少先决知识,(2)SFT监督与预训练知识之间的冲突,(3)SFT数据内部不一致,(4)连续微调期间的左侧遗忘,以及(5)对罕见或复杂模式的优化不足。我们引入了一个诊断优先的框架,该框架使用可观察的训练和推理信号将未学习的样本映射到这些原因,并研究了几种有针对性的缓解策略作为因果干预措施。 Qwen、LLaMA 和 OLMo2 上的实验表明,不完全学习是普遍存在且异构的,并且聚合指标的改进可以掩盖持久的未学习子集。研究结果强调需要对监督式 微调 未能学习的内容及其原因进行细粒度诊断。