论文
取消属性以忘记 LLM 遗忘
De-attribute to Forget for LLM Unlearning
摘要
大语言模型(LLM)的快速发展引起了人们对使用不适当数据进行训练的担忧,这导致人们对 LLM 去学习的兴趣日益浓厚。许多现有的 LLM 忘却方法依赖于优化预测损失,例如最大化遗忘集的损失,但经常面临诸如过度遗忘和模型效用不佳等关键问题。为了解决这些问题,本文新颖地将 LLM 遗忘的优化目标框架为将数据归因归零之一。特别是,我们提出了第一个基于数据归因奖励的 LLM 去学习框架,称为 DareU,该框架执行强化学习,通过降低其生成的响应的归因分数(即去归因)来更新 LLM 到忘记数据所有者。使用 LLM 分类器作为归因的有效近似进行的实证评估表明,DareU 通过实现有效的遗忘,同时很好地平衡遗忘质量和模型效用,从而优于现有基线。