论文
忘却者可能会说谎:在 LLM 忘却中评估和提高诚实度
Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning
摘要
大语言模型 (LLM) 中的取消学习旨在删除有害的训练数据,同时保留整体效用。然而,我们发现现有的方法经常产生幻觉、生成异常的词元序列或行为不一致,从而引发安全和信任问题。根据先前有关 LLM 诚实的文献,此类行为通常与不诚实相关。这促使我们在模型遗忘的背景下研究诚实的概念。我们提出了遗忘诚实的正式定义,其中包括:(1)保留保留知识的实用性和诚实性,以及(2)确保有效遗忘,同时鼓励模型承认其局限性并对与遗忘知识相关的问题做出一致反应。为了系统地评估遗忘的诚实性,我们引入了一套指标,涵盖 Q&A 和 MCQ 设置中的效用、保留集的诚实性、遗忘的有效性、拒绝率和拒绝稳定性。对 3 个主流系列的 9 种方法进行评估表明,所有当前方法都无法满足这些标准。经过实验和理论分析,我们提出了 ReVa,一种表示对齐程序,可以微调特征随机化的未学习模型,以更好地识别被遗忘的知识。在遗忘集的问答任务上,ReVa 在两轮交互后达到了最高的拒绝率,几乎是第二好的方法性能的两倍。值得注意的是,它还提高了保留集的诚实度。我们在 https://github.com/renjiegu 发布了我们的数据和代码。