论文

MANCE:流形感知概念擦除

MANCE: Manifold Aware Concept Erasure

模型训练模型编辑与遗忘

摘要

概念擦除旨在从表示中删除目标概念,同时保留其中编码的其他信息。这很困难,因为表示编码了许多通常与擦除目标相关的概念,因此删除目标可能会损坏它们。我们提出流形约束假设(MCH):如果自然表征集中在结构化的低维流形上,那么干预措施应该限制在该流形上,并在干预期间更好地保留表征中编码的其他信息。我们以一种新的概念擦除方法实例化 MCH:MANifold 感知概念擦除(MANCE)。 MANCE 使用来自预测目标概念的分类器的信号对表示进行迭代更新。我们使用从自然输入获得的表示来估计流形,然后将概念删除更新投影到估计的流形上。我们对涵盖文本和视觉的 119 个设置进行了广泛的评估,包括 13 个语言模型、三个 NLP 概念和 40 个 CelebA-CLIP 属性。在以前的方法之上采用 MANCE 显示出一致的改进泄漏结果。我们还引入了 MANCE+ 和 MANCE++,它们在使用 MANCE 之前预先考虑了封闭式擦除算法,从而实现了更好的泄漏——相对于匹配的全空间更新的手术性权衡。 MANCE++ 是我们最好的方法,在非线性概念擦除方面取得了最先进的结果。这些结果支持抹除环境中的 MCH:干预措施应限制在自然表征流形内。