论文

跨越边界悬崖:通过边界校准迈向抗再学习的LLM遗忘

Crossing the Margin Cliff: Toward Relearn-Robust LLM Unlearning via Margin Calibration

模型训练模型编辑与遗忘

摘要

大语言模型遗忘在再学习攻击下始终表现脆弱。在TOFU上,仅对20个遗忘样本微调就能大幅恢复留出遗忘集的ROUGE,且对我们评估的每一种方法皆然;我们将这种脆弱性溯源至优化几何。横跨梯度、偏好与蒸馏三族的14种事后方法,其逐token答案边界在42个方法-规模组合中的41个里收敛于保留参照上方的一个窄带,我们将这一规律称为边界悬崖(margin cliff)。我们证明,只要保留耦合使遗忘内容的诊断对数几率(log-odds)保持在某个下限之上,该悬崖就必然出现;这一条件由token饱和损失在平稳点处诱发,我们在42个组合中的34个上直接验证了它。边界校准(Margin Calibration,MC)是一种即插式修饰:它在参照的逐token边界处锚定一个非饱和边界合页,并在不相交指令语料上添加KL探测,在原生损失饱和之处恢复遗忘侧压力。在一个明示的梯度主导条件下——我们通过对该修饰进行插桩测量了其在轨迹上的梯度签名——其平稳点集位于跨越悬崖的一侧,从而给出再学习边界提升的攻击预算上界。在TOFU(三种Llama-3规模、三个遗忘层级)、Llama-2-7B-hf上的MUSE-News以及一个Phi-3.5面板上,单一冻结配置赢下全部14项遗忘正面对比聚合与全部有数据的再学习组合(面板平均攻击后ROUGE-L为0.41至0.18),并在13/14上降低原始成员推断AUC,主要代价是保留侧效用的下降。一个部署变体无需以保留集训练的参照即可取得相同收益。

跨越边界悬崖:通过边界校准迈向抗再学习的LLM遗忘:论文配图
图 1:遗忘设定边距诊断 mθ​(𝒟f)m_{\theta}(\mathcal{D}_{f})(方程 (2)),针对 3 个 Llama-3 尺寸的 14 个基线(灰色)和 MC(蓝色),按损失系列排序。红色虚线是mrefm_{\mathrm{ref}},阴影带是悬崖间隙。意思是豆腐MU注释。