论文

模型遗忘目标因不同的语言功能而异

Model Unlearning Objectives Vary for Distinct Language Functions

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 在预训练期间学习不良属性,包括危险知识和有毒文本生成。正如 后训练 使用不同的目标来塑造不同的行为一样,我们认为应该针对所讨论的语言功能设计遗忘方法。为了研究这个问题,我们考虑了两个机制上不同的遗忘目标:危险知识遗忘和毒性遗忘。对于危险知识,我们引入了基于余弦的元学习 RMU 变体。对于毒性,我们提出了基于特定层探测方向的多层目标。在四种开源 7-8B 模型中,我们的方法基于两种类型的忘却的不同训练目标取得了很好的结果。总的来说,我们的结果表明,遗忘应该作为一系列问题来研究,类似于 LLM 后训练 的多种类型。