论文

学习要忘记什么:通过学习 词元级 重要性来改善 LLM 遗忘

Learning What to Forget: Improving LLM Unlearning via Learned Token-Level Importance

模型训练模型编辑与遗忘

摘要

机器去学习的目的是从经过训练的模型中删除目标知识,同时保留其一般功能。对于自回归语言模型,并非遗忘样本中的所有标记都与遗忘同等相关。现有的方法要么忽略这种异质性,要么依赖辅助模型、启发式或外部注释来估计每个标记与遗忘的相关性。相反,我们通过与保留目标的交互来表征它:词元是特定于遗忘的,最小化该词元上的遗忘损失不会与保留最优性冲突。我们将这一观点形式化为模型参数和词元权重的联合优化问题,并表明,在自然分离条件下,所得目标恢复了预言机忘记特定词元的支持。受此公式的启发,我们引入了交替词元加权取消学习(ATWU),这是一个轻量级框架,它在取消学习期间使用隐藏状态上的简单线性评分器联合学习词元忘记特异性和模型参数,而无需外部 词元级 监督。在 TOFU 和 RWKU 中,ATWU 实现了最先进的遗忘-保留权衡,优于样本级方法、基于概率的词元加权启发式方法和基于辅助模型的方法。此外,学习到的分数与 真值 遗忘特定范围更好地一致,表明 ATWU 识别了语义上有意义的 词元级 遗忘信号。总体而言,我们的结果表明,保留冲突为识别语言模型应该忘记哪些内容提供了有效的标准,从而能够以最小的计算开销直接从模型表示中无监督地学习 词元级 忘记特异性。