论文

用于持续 LLM 遗忘的轨迹引导遗忘恢复网络

Trajectory-Guided Forget-Recover Network for Continual LLM Unlearning

模型训练模型编辑与遗忘

摘要

机器取消学习旨在消除敏感数据对模型的影响。在现实世界中,忘记学习的请求不断出现,这带来了两个挑战。首先,遗忘干预可能会在剩余路径上重新分配与目标相关的计算,从而使之前被遗忘的知识重新出现。其次,重复的遗忘干预可能会逐渐降低保留保留效用所需的模型能力。为了应对这些挑战,我们提出了轨迹引导的遗忘恢复网络(TFR-Net)。 TFR-Net 跟踪跨请求的渠道级风险。它将持久的目标相关通道与瞬态热点分开,并仅抑制持久的通道。 TFR-Net 还通过重新激活休眠通道来恢复模型容量。这些渠道对保留效用做出了巨大贡献,并且当前和历史遗忘风险较低。仅当保留效用降级保持在预定义的容差范围内时,恢复才被接受。对四个数据集的实验表明,与代表性基线相比,TFR-Net 在遗忘有效性和保留效用之间始终实现了更有利的权衡。