论文
您的遗忘告诉您:识别扩散模型中被删除的概念
Your Unlearning Gives You Away: Identifying Erased Concepts in Diffusion Models
摘要
现有的对未学习扩散模型的攻击假设被擦除的概念是预先已知的,并专注于恢复它们。然而,在实践中,模型提供者可能不会透露哪些概念已被删除,即使可以访问原始基础模型,对手可能仍然缺乏明确的攻击目标。在本文中,我们旨在回答以下关键但被忽视的问题:哪些概念已从模型中删除,总共删除了多少概念?为此,我们推出了 Tracer,这是一个能够快速准确地识别被删除概念并估计其数量的框架。 Tracer 可以有效地识别被删除的概念,而无需生成和分类图像。通过结合权重足迹的轻量级频谱分析,它可以对大型候选词汇表进行高效搜索。为了区分多个被删除的概念,我们引入了一个足迹覆盖目标来指导顺序发现。 Tracer 通过检测候选置信度的急剧下降来估计已擦除概念的数量,因为所选概念说明了擦除足迹,而不需要标记示例进行校准。该框架仅需要轻量级线性代数和有限的前向探针,无需事先了解遗忘算法。文本到图像和文本到视频骨干模型以及各种遗忘方法的实验表明,Tracer 可以在几秒钟内识别被删除的概念并估计其数量,与图像和视频模型上的 MIA 和暴力搜索相比,分别实现了 150 至 137,000 倍和 133 至 20,000 倍的加速,并且识别精度显着提高。
