论文

Uni-AdaVD:通过正交值分解进行视觉生成的通用概念擦除

Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition

模型训练模型编辑与遗忘

摘要

视觉生成模型不可避免地会从未经整理的预训练数据中吸收不需要的概念,从而使概念擦除对于安全部署至关重要。然而,现有的擦除方法通常是特定于体系结构的,并且很难在保留非目标内容和生成先验的同时删除目标概念。我们提出了 Uni-AdaVD,一种用于视觉生成的通用推理时间概念擦除框架。 Uni-AdaVD 将多模态注意力的价值空间视为统一的干预空间,并引入编码器感知的目标表示构造来跨异构文本编码器定位目标语义。它进一步将正交值分解与自适应擦除移位相结合,以抑制目标语义方向,而无需更新原始模型权重。对 U-Net、DiT 和自回归图像生成器以及文本到视频模型的广泛实验表明,在保留非目标先验的同时,在单概念和多概念擦除方面具有强大的性能。这些结果表明 Uni-AdaVD 为现代视觉生成模型提供了一种高效且适应性强的安全机制。我们的代码可在 https://github.com/QifanZhou/Uni-AdaVD 获取。