论文
PEAK:通过 k-稀疏自动编码器进行精确且持久的概念擦除
PEAK: Precise and Persistent Concept Erasure via k-Sparse Autoencoders
摘要
由于人们对侵犯版权、侵犯隐私和攻击性内容的担忧日益增加,从大规模文本到图像 (T2I) 传播模型中删除概念变得越来越重要。现有的方法很难实现精确和持久的概念擦除:概念相关表示的不准确定位可能会导致意外的语义干扰,而底层概念知识的不完全删除则允许对抗性恢复。为了解决这个困境,我们提出了 PEAK,一个通过 k-稀疏自动编码器(kSAE)的 \textbf{\textit{precise}} 和 \textbf{\textit{persistent}} 概念擦除框架。 PEAK 首先在扩散去噪网络的内部激活上训练 kSAE,以将密集表示分解为可解释的稀疏特征。通过对比目标和非目标提示引起的稀疏激活,PEAK 根据激活强度和频率识别一组紧凑的特定于目标的特征。然后,这些局部特征用于参数优化,其中 PEAK 选择性地抑制目标相关的激活,同时保留对原始模型的补充非目标激活。这种特征引导的优化将概念擦除直接嵌入到扩散参数中,无需额外的推理时间干预,并有助于有效持久地抵御对抗性攻击。大量实验表明 PEAK 实现了有效且稳健的概念擦除。在 I2P 基准测试中,PEAK 将 NudeNet 检测数从 582 减少到 6,将平均攻击成功率 (ASR) 从 96.52\% 降低到 5.63\%,并以接近零的 KID 保持 MS-COCO 上的总体生成质量。我们的代码和模型位于:https://github.com/manmanTAT/PEAK