论文
并非每项更改都是必要的:大型语言模型中可恢复的漂移无法学习
Not Every Change Is Necessary: Recoverable Drift in Large Language Model Unlearning
摘要
大型语言模型中的机器取消学习旨在删除不需要的知识,同时保留模型的剩余功能。尽管现有方法使用保留目标或限制编辑发生的位置,但达到所需的遗忘水平仍然会留下损害非目标行为的附带变化。我们的恢复比较表明,其中一些变化可以逆转,同时保留观察到的遗忘表现。在这项工作中,我们提出了 Propose-Then-Project Unlearning (PTP-U),这是一个将目标遗忘与非目标能力恢复相结合的框架。 PTP-U 首先应用局部分析编辑来削弱目标知识关联,然后将非目标输出分布与原始模型的输出分布对齐,以恢复能力,同时保持固定的遗忘约束。这两个阶段都有一个共同的目标:满足遗忘要求,同时保持非目标任务的流畅生成和性能。在三个基准测试中,PTP-U 在评估的方法中实现了最强的遗忘-保留权衡,达到 平均遗忘率为 81.22%-91.03%,同时保留 94.20% 的非目标效用。在匹配遗忘中,PTP-U 始终保持较高的非目标效用。