论文

CURATE:实时持续忘却,确保 LLM 知识的保存

CURaTE: Continual Unlearning in Real Time with Ensured Preservation of LLM Knowledge

模型训练模型编辑与遗忘

摘要

由于无法提前从 预训练 或 大语言模型 中过滤掉所有可能有问题的数据,因此需要在训练后忘记特定知识的方法。现有技术忽视了持续和立即采取行动的必要性,导致它们随着更新的积累和敏感信息的长期暴露而遭受实用性下降。为了解决这些问题,我们提出实时持续忘却并确保 LLM 知识保存 (CURaTE)。我们的方法首先在数据集上训练句子嵌入模型,该模型旨在形成清晰的决策边界,以确定给定的输入提示是否对应于任何存储的遗忘请求。然后,使用给定输入与忘记请求的相似性来确定是否应答或返回拒绝响应。我们证明,即使采用如此简单的方法,CURaTE 不仅能够比现有方法实现更有效的遗忘,而且通过避免修改语言模型参数,它还能在任意数量的更新中保持近乎完美的知识保存,并且是唯一能够实时持续忘却的方法。