论文

不重写的学习:持续推理中的自我蒸馏理论和监督微调

Learning without Overwriting: A Theory of Self-Distillation and Supervised Fine-Tuning in Continual Reasoning

模型训练持续学习

摘要

大语言模型 (LLM) 的 在策略自蒸馏 (OPSD) 已证明能够提高推理能力,同时保留以前获得的知识。尽管在实证上取得了巨大的成功,但 OPSD 在持续推理中的动态仍未完全被理解。将LLM推理建模为有向无环图搜索,我们对持续学习中后训练——OPSD 和监督微调 (SFT) 的动态以及预训练对后续性能的影响提供了统一的理论分析。我们的研究结果建立了三个具有优化保证的关键见解:(i)具有来自正确输出的提示的 OPSD 通过由提示结构引起的稀疏但有效的梯度下降更新,可以实现持续学习,而不会忘记。 (ii) 正确推理路径上的 SFT 可能会导致灾难性遗忘,因为沿训练路径的密集更新会覆盖先前获取的信息。 (iii) 当执行轨迹从中间状态开始时,训练之前的多样性对于使后训练模型能够达到正确的输出至关重要。我们的结果在理论分析的支持下表明,可靠的连续推理取决于后训练更新如何与训练之前建立的推理结构交互。