论文

坦白你所知道的:LLM Unlearning 中忘记设置与模型知识的不一致

Confess What You Know: Forget-Set Misalignment with Model Knowledge in LLM Unlearning

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 的机器取消学习通常假设预定义的遗忘集与模型记忆的内容相匹配,但这经常会破坏原始训练数据无法访问的现实隐私设置。我们将这种间隙称为“忘记设置错位”,并确定了两种情况。在“遗忘”中,遗忘集忽略了记忆的信息,并且泄漏仍然存在。在知识外遗忘中,算法会“忘记”模型从未学过的知识,从而扰乱参数并降低效用。使用梯度水平分析,我们表明这些行为是由于未学习的目标不一致而不是特定的优化选择引起的。然后,我们提出了 CONfession-to-Forget-Set (CONFS),这是一种数据盲框架,通过引出和形式化模型的记忆知识来构建模型对齐的遗忘集。在综合、多模式和现实世界的基准测试中,CONFS 在多个指标上接近金标准性能,并实现了有竞争力的遗忘-效用平衡,同时比其他数据盲忘记集结构更好地保留了效用。