论文
ZeroUnlearn:大语言模型 中的少量知识忘却
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
摘要
由于在海量网络语料库上进行训练,大语言模型 不可避免地会保留敏感信息,这些信息被定义为可能导致有害生成的输入,引发了对隐私和安全的担忧。现有的机器遗忘方法主要依赖于再训练或激进的 微调,这些方法要么计算成本高,要么容易降低相关知识和整体模型效用。在这项工作中,我们通过模型编辑将机器遗忘重新表述为精确的知识重新映射问题。我们提出了 ZeroUnlearn,一个小样本的忘却框架。它通过将敏感输入映射到中性目标状态并删除其原始表示来覆盖敏感输入。 ZeroUnlearn 通过封闭式解决方案的乘法参数更新来强制表示正交性,从而实现高效且有针对性的取消学习。我们进一步将 ZeroUnlearn 扩展为基于梯度的变体,用于多样本取消学习。实验表明,我们的方法优于现有基线,同时保留了一般模型的实用性。我们的代码可在 github 上找到:https://github.com/XMUDeepLIT/ZeroUnlearn。