论文
可区分删除:大语言模型 Unlearning 的统一知识擦除和拒绝
Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning
摘要
减少敏感和有害输出是确保 LLM 安全部署的基础。现有方法通常遵循两种范例:知识删除(KD),它在训练期间删除不需要的信息;可区分拒绝(DR),它引导模型在推理过程中避免使用敏感知识。尽管取得了快速进展,但基于 KD 的忘却由于抑制特定标记序列作为完全知识删除的替代品而面临着偏见删除的问题,而基于 DR 的忘却则面临着有害知识重新出现的风险,因为底层知识仍然完好无损。为了解决这些问题,我们提出了可区分删除($\mathrm{D^2}$),这是一种限制潜在表示中的响应分布而不是特定标记的范式,以消除不需要的知识,同时将其与保留的知识区分开来,从而启用拒绝机制来安全、连贯地处理未学习的输入。为了实现 $\mathrm{D^2}$,我们引入了一个能量指数,该指数可以量化知识的存在以及未学习内容和保留内容之间的分离。数学和实证分析表明,能量既准确又高效,使得基于能量的忘却对齐(EUA)能够在训练期间强制执行能量边界忘却,并在推理时应用基于能量的拒绝机制。大量实验表明 EUA 显着优于以前的方法,表明 $\mathrm{D^2}$ 的优越性。我们的代码位于 https://github.com/Puning97/EUA-for-LLM-Unlearning。