论文
分歧解码:通过辅助模型进行推理时遗忘
Divergence Decoding: Inference-Time Unlearning via Auxiliary Models
摘要
大语言模型 (LLM) 经常记住敏感的训练数据,从而产生重大的隐私和版权风险。解决这些风险,即从现有模型检查点中删除此类知识,已被证明具有挑战性,因为许多遗忘方法会导致灾难性的效用损失或对复杂查询无效。我们引入了发散解码(DD),这是一种使用小型辅助模型在推理过程中引导 logits 或 LLM 远离特定数据的机制。训练这些模型非常简单,即我们使用标准 预训练 和 微调 设置。我们发现该方法在各种模型和训练数据集规模的遗忘基准上明显优于最先进的(SOTA)基线,这与 DD 是一种有效且廉价的遗忘解决方案一致。然后,我们证明这种引导分布可以简单地回归到基本模型中。由于该方法通常适用于任何概率模型,因此我们在文本生成之外探索其功效,并找到泛化到图像领域的证据。