论文
将 LLM 忘却建模为不对称双任务学习问题
Modeling LLM Unlearning as an Asymmetric Two-Task Learning Problem
摘要
大语言模型 (LLM) 的机器取消学习旨在删除目标知识,同时保留一般能力。在本文中,我们将 LLM 遗忘问题重新定义为一个不对称的双任务问题:保留是主要目标,遗忘是辅助目标。从这个角度来看,我们提出了一种保留优先的梯度合成框架,该框架将特定于任务的梯度提取与冲突感知组合解耦。在实例化该框架时,我们采用已建立的 PCGrad 来解决梯度冲突,并引入 SAGO,一种新颖的保留优先的梯度合成方法。理论上,两种变体都确保与保留梯度的非负余弦相似性,而 SAGO 通过建设性符号约束合成实现严格更紧密的对齐。根据经验,在 WMDP Bio/Cyber 和 RWKU 基准上,SAGO 始终推动帕累托前沿:例如,在 WMDP Bio (SimNPO+GD) 上,目标模型 MMLU 性能的恢复从 44.6%(朴素)发展到 94.0%(+PCGrad),并进一步达到 96.0%(+SAGO),同时保持相当的遗忘强度。我们的结果表明,重新塑造梯度几何形状,而不是重新平衡损失,是减轻遗忘与保留权衡的关键。