论文

EraseSAE:通过稀疏自动编码器在文本到视频扩散模型中擦除手术概念

EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders

模型训练模型编辑与遗忘

摘要

文本到视频 (T2V) 传播模型的最新进展已经展示了卓越的生成能力,但它们对松散管理的训练数据的依赖引发了紧迫的安全和版权问题。概念擦除提供了一种原则性的补救措施,即从预训练模型中删除不需要的语义,同时保留剩余的概念。然而,现有方法通常在粗粒度上运行,与概念表示的细粒度、分布式性质不一致,导致去除不完全或生成质量下降。我们认为,手术擦除从根本上需要在单义特征层面进行干预,其中每个单元编码一个可解释的概念。为此,我们提出了 EraseSAE,这是一种新颖的框架,利用稀疏自动编码器通过原则性的分解-属性-擦除管道在基于 DiT 的 T2V 扩散模型中实现手术概念擦除。我们首先介绍分区卷积稀疏自编码器,它将密集的时空激活分解为解开的、可解释的稀疏特征,同时保持时空一致性。然后,对比归因机制会对比配对提示的激活,以隔离特定于概念的特征内核。推断时,从已识别的内核派生的时间步长解析的时空掩码将擦除限制在目标概念活跃的区域,而使不相关的内容保持完整。跨不同扩散模型和概念擦除任务的大量实验表明,EraseSAE 能够以最小的质量下降实现精确、稳健的概念删除,大大优于最先进的方法。代码可在 https://github.com/HiDream-ai/EraseSAE 获取。