论文

调和关于SFT在LLM中有效性的矛盾观点:交互视角

Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective

模型评测模型行为与机制分析

摘要

本文探讨监督微调(SFT)中的一个科学问题:为什么SFT对小规模深度神经网络普遍有效,但应用于大语言模型(LLM)时却可能产生不一致甚至有害的效果。基于交互解释的最新进展表明,词/token之间的交互为量化LLM所编码的推理模式提供了一个忠实的度量。我们发现SFT过程中交互的演化可以有效解释SFT对LLM效果不一致的现象。具体而言,我们发现:(1) SFT主要去除类噪声交互,而很少获得可靠的新交互。(2) 这一去噪阶段极为短暂,此后继续微调往往会引入过拟合的交互。我们在多个LLM和数据集上验证了这些发现。我们的发现为早停提供了新见解,并为LLM训练提供了实用指导。

调和关于SFT在LLM中有效性的矛盾观点:交互视角:论文配图
图 1:(上)LLM 的复杂推理模式可以通过逻辑模型 phi⁡(⋅)\phi(\cdot) 中的一些交互(短语模式)忠实地表示。 (下)SFT 首先进入一个简短的去噪阶段,消除类似噪声的相互作用,这些相互作用是不可泛化且相互抵消的。在随后的长时间过度拟合阶段,LLM 逐渐再次学习新的类噪声交互。