论文
狭隘地遗忘,广泛地保留:将学习视为不对称泛化问题
Forget Narrowly, Retain Broadly: Unlearning as an Asymmetric Generalization Problem
摘要
LLM 中的机器取消学习是有针对性地删除特定知识,同时保留所有其他功能,这对于隐私和安全至关重要。然而现有的基准衡量它并不可靠。他们错过了在释义或间接查询下重新出现的知识,我们称之为遗忘不足,并且缺乏验证不相关知识被保留所需的语义、句法和词汇探测,我们称之为过度遗忘。这两次失败都反映了不对称泛化问题。遗忘评估必须涵盖相同目标事实的不同查询公式,测试遗忘是否超出了精确的训练提示。保留评估必须探测一个更大且隐式定义的集合,即与忘记目标不相交的每个事实。因此,保留集定义了有效的遗忘集,但当前数据集没有提供此遗忘-保留边界的细粒度注释。我们通过 SUITE 来解决这个问题,这是一种评估协议和训练语料库,可以捕获现实世界事实领域的遗忘-保留结构。在 SUITE 上训练的方法得到了显着改善,这表明训练数据与算法设计一样重要。基于所获得的见解,我们引入了 JensUn++,这是一种取消学习算法,它在顺序和联合取消学习设置中实现了三个 LLM 的最佳遗忘-保留效用权衡。代码和数据集可在 https://amitpeleg.github.io/forget-narrowly-retain-broadly 获取