论文

光谱遗忘:无需重新训练即可事后恢复受损能力

Spectral Unforgetting: Post-Hoc Recovery of Damaged Capabilities Without Retraining

模型训练模型编辑与遗忘

摘要

微调 目标任务的语言模型通常会降低训练数据从未明确威胁的能力。我们研究了这种被称为灾难性遗忘的现象,并提出了一种事后修复解决方案,该解决方案仅使用预训练的检查点 $W_{\mathrm{base}}$ 及其微调的后代 $W_{\mathrm{ft}}$。目标不仅仅是将模型恢复到基本检查点,而是恢复被 微调 损坏的功能,同时保留目标任务增益和任何有益的保留改进。我们引入了 DG-Hard,一种用于 微调 更新 $Δ= W_{\mathrm{ft}} - W_{\mathrm{base}}$ 的仅检查点谱修复方法。 DG-Hard 将 $Δ$ 视为嵌入在类似 IID 的噪声残差中的低秩任务对齐信号,梯度下降没有动机去除该残差,并将 Donoho-Gavish 硬奇异值阈值应用于每个权重增量矩阵,保留更新的结构化高能部分并去除频谱块。这减少了对封闭式 SVD 滤波步骤的修复,无需依赖于数据的调整。一个核心困难是评估:平均准确度隐藏了每个基准的失败,而幼稚的恢复分数奖励模型只是简单地恢复到基础。因此,我们引入了一个分区条件指标,它分别跟踪修复、保存、无损坏和目标任务保留。在 14 美元(模型、任务)设置和九个跨域保留基准中,DG-Hard 在事后基准中实现了最强的平衡修复。尽管没有使用对齐数据,DG-Hard 还可以恢复三个独立安全轴上因良性 微调 而降级的安全对齐。这些结果表明,微调 引起的部分能力损失并不是专业化不可避免的结果,而是权重更新本身中可去除的谱残留。