论文
独家忘却
Exclusive Unlearning
摘要
当将 大语言模型 (LLM) 引入医疗保健和教育等工业应用时,生成有害内容的风险成为一个重大挑战。现有的机器遗忘方法虽然可以消除特定的有害知识和表达方式,但有害内容的多样性使得全面清除变得困难。在这项研究中,我们没有单独列出遗忘目标,而是提出了排他性遗忘(EU),其目的是通过广泛遗忘除我们希望保留的知识和表达之外的所有内容来消除广泛的伤害。我们证明,通过Exclusive Unlearning,可以获得一个模型,确保针对各种输入(包括越狱)的安全性,同时保持响应与医学和数学等特定领域相关的各种指令的能力。