论文
PreUnlearn:在 大语言模型 取消学习之前审核附带知识损坏
PreUnlearn: Auditing Collateral Knowledge Damage Before Large Language Model Unlearning
摘要
大语言模型 (LLM) 的机器取消学习旨在删除指定的知识,同时保留模型的其余功能。然而,要忘记的知识和要保留的知识之间的界限通常并不明确,因为相关甚至遥远的信息可能会纠缠在模型中。在本文中,我们从以数据为中心的角度研究 LLM 遗忘,并测量遗忘效果如何从遗忘集传播到同域和远域知识,而不是在遗忘之后而是之前。我们发现了一致的衰减模式:附带损害在遗忘集附近最强,随着语义距离的增加而减弱,但在域边界处不会消失。我们进一步询问在执行遗忘之前是否可以审核此类损害。我们将遗忘集审计制定为预忘却预测任务,并分析哪些数据特征最能预测下游损害。我们的结果表明,遗忘集和评估集之间的交互特征提供了最强的信号,这表明附带损害在模型更新发生之前部分反映在数据几何中。这些发现将遗忘设置审计定位为一种早期预警工具,用于识别有风险的遗忘运行并设计更可靠的遗忘程序。代码和数据可在 https://github.com/BartSu/PreUnlearn 获取。