论文

不要忘记您的嵌入:通过精确编辑嵌入来实现强大的知识擦除

Don't Forget Your Embeddings: Robust Knowledge Erasure via Precise Editing of Embeddings

模型训练模型编辑与遗忘

摘要

随着语言模型越来越多地部署在现实世界的应用程序中,从其中删除特定知识的能力对于安全性和合规性变得至关重要。著名的方法通过更新模型参数来寻求持久删除,但目标知识通常可以通过对抗性提示或重新学习来恢复。在这项工作中,我们假设这种限制部分源于忽略嵌入层的现有方法。为了解决这个问题,我们引入了 EMBedding ERasure (EMBER),这是一种即插即用的擦除模块,它利用稀疏矩阵分解从词元嵌入中精确擦除与概念相关的特征。通过对 Gemma-2-2B-it 和 Llama-3.1-8B-Instruct 上不同概念的综合评估,我们发现使用 EMBER 增强现有方法能够持续提高跨任务格式的擦除效率和特异性,同时将一致性损失降至最低。此外,它极大地提高了重新学习的鲁棒性,将重新获得的准确率降低了 50%,将 Llama 的准确率限制为 35%,而之前的方法为 70%-76%。进一步分析表明,一致性成本是局部的,仅影响一小部分概念专有标记。我们的工作表明,精确的嵌入级干预对于稳健的概念擦除是必要的,并证明现有方法可以从这种增强中受益。