论文
调和关于SFT在LLM中有效性的矛盾观点:交互视角
Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective
摘要
本文探讨监督微调(SFT)中的一个科学问题:为什么SFT对小规模深度神经网络普遍有效,但应用于大语言模型(LLM)时却可能产生不一致甚至有害的效果。基于交互解释的最新进展表明,词/token之间的交互为量化LLM所编码的推理模式提供了一个忠实的度量。我们发现SFT过程中交互的演化可以有效解释SFT对LLM效果不一致的现象。具体而言,我们发现:(1) SFT主要去除类噪声交互,而很少获得可靠的新交互。(2) 这一去噪阶段极为短暂,此后继续微调往往会引入过拟合的交互。我们在多个LLM和数据集上验证了这些发现。我们的发现为早停提供了新见解,并为LLM训练提供了实用指导。
