论文
可控生成的语义引导:多模态扩散中的免调整概念擦除 Transformer
Semantic Steering for Controllable Generation: Tuning-Free Concept Erasure in Multimodal Diffusion Transformers
摘要
多模态扩散 Transformer (MM-DiTs) 表现出了卓越的文本到图像生成性能,超越了传统的基于 U-Net 的扩散模型。然而,它们强大的生成能力也引起了重大的安全问题,因为它们可能会生成敏感或不适当的内容。虽然现有的概念擦除方法旨在减轻此类风险,但大多数方法都需要修改模型参数,而这些参数通常是特定于体系结构的,对于部署的较大模型来说是不切实际的。由于深度嵌入的知识、广泛的语义空间和上下文相关的文本编码器,几种免调优方法在应用于高级大规模 MM-DiT 时面临挑战。为了应对这些挑战,我们建议通过直接操纵模型的内部表示来消除概念。我们的主要见解源自对 MM-DiT 的块式生成角色的深入分析,即文本条件语义表示在 MM-DiT 的中间块中最为突出。基于此,我们从中间块中提取不需要的概念和所需的安全概念的表示,根据它们的差异构造一个引导向量,并将这个单个向量注入到连续的早期和中间块中。通过专门对稀疏文本分支标记进行操作并利用整流流的直接采样轨迹,我们的方法以可忽略的开销且无需任何训练即可实现有效的概念擦除。跨 MM-DiT 模型的大量实验表明,我们的方法在消除不同概念方面实现了最先进的性能,能够有效控制最终输出,并且对对抗性攻击保持鲁棒性。