论文
距离并不足够:遗忘-保留对齐差距预测大语言模型再学习鲁棒性
Distance Is Not Enough: Forget-Retain Alignment Gap Predicts LLM Relearning Robustness
摘要
机器遗忘旨在让模型忘掉特定数据,但经过遗忘处理的大语言模型常常难以保持遗忘状态:短暂的微调即可复活被移除的知识。现有鲁棒性预测器依赖全局权重空间位移,但当随机或破坏性更新导致性能崩溃时,仅凭距离会产生误导。我们主张,再学习鲁棒性取决于更新结构:鲁棒的遗忘应影响遗忘关键权重,同时避开保留关键权重。我们提出遗忘-保留对齐差距(FRAG),一个免训练的预测器,无需运行再学习攻击即可为更新的遗忘-保留对齐程度打分,且比全局距离更可靠地区分选择性更新与稠密更新。基于“影响遗忘关键、避开保留关键”这一原则,遗忘-保留剪枝(FRP)提升了再学习鲁棒性。我们的结果表明,权重选择性比单纯的距离更能解释鲁棒性。代码见https://github.com/Yi1-Chen/FRAG。
