论文
GRACE:用于大语言模型遗忘的梯度引导核心集选择
GRACE:Gradient-guided Coreset Selection for LLM Unlearning
摘要
大语言模型的机器遗忘方法通常假设预先指定的遗忘和保留集。然而,在现实环境中,请求可能仅提供一些不良行为的示例,需要从异构语料库中推断出忘记和保留集。我们研究了这个数据选择问题,并提出了 GRACE,这是一种梯度引导的核心集选择方法,可以为 LLM 去学习构建遗忘集和保留集。 GRACE 首先根据引发不良行为的种子示例计算遗忘方向,然后选择一个紧凑的遗忘核心集,其梯度使用非负正交匹配追踪逼近该方向。为了保留模型效用,它在投影出遗忘方向并在剩余梯度空间中应用聚类正交匹配追踪后选择保留示例。在两个目标领域、两个模型系列和四种遗忘算法中,GRACE 提高了模型实用性,同时保持了可比较的遗忘质量,与之前基于梯度的选择方法相比,具有特别一致的增益。
