论文

微调的一阶模型何时能约束遗忘?

When Can First-Order Models of Fine-Tuning Bound Forgetting?

模型训练持续学习

摘要

根据新数据微调语言模型可能会使其忘记应该保留的事实。我们询问在微调运行开始时进行的测量是否可以限制每个受保护事实的运行使模型忘记它的概率。在对 0.6B 到 14B 参数的模型进行随机梯度下降的 LoRA 微调中,由有限差分探针估计的一阶响应模型预测实际裕度的变化,相关性为 0.974-0.998。然而,基于该模型构建的遗忘预测失败了,因为遗忘需要远远超出模型验证区域的参数更改。然而,探针可以限制裕度首先低于接近零的边界的概率:我们推导出裕度的线性替代项的 Freedman 和 Azuma 首次传代界限,并在新的运行中测试它们是否适用于模型。边界包含一项 R,用于测量运行期间响应系数的变化量。简化的弗里德曼界限设置 R = 0,证明了大多数事实,但在 112 个条件中的 14 个中被违反,并且每个被违反的事实都具有 R >= a,其中 a 是事实边缘到边界的距离。完整的弗里德曼界限仅证明 R < a 的事实,并且在每种条件下都成立。在违反事实的情况下,测试运行中裕度的分布中位数是响应模型预测的 14.6 倍,因此失败是模型的故障,在我们的数据中,它们仅发生在 R >= a 的情况下。我们事后发现了这种模式,并在两项预先注册的验证性研究中使用 43 个新条件对其进行了测试:所有这些条件都满足完整的界限,而简化界限仅在 3 个事实上失败,每个事实的 R >= a。因此,一阶微调模型可以限制对响应系数变化小于其到边界距离的事实的遗忘。