论文
学习文本到图像模型中后门防御的正态扩散动力学
Learning Normal Diffusion Dynamics for Backdoor Defense in Text-to-Image Models
摘要
后门攻击对文本到图像(T2I)扩散模型的安全部署构成严重威胁。现有的防御措施通常从内部表示中的特定异常模式中检测后门,随着日益多样化的攻击机制的出现,这可能会限制其普遍性。在本文中,我们从转换动力学的角度研究 T2I 扩散模型的后门防御。我们观察到,良性扩散轨迹表现出来自交叉注意力、潜空间和噪声空间的结构化和时间步依赖的过渡模式,而后门攻击往往会导致这种正常进化的偏差。受这些观察的启发,我们提出了正态扩散动力学学习(NDDL),这是一种新颖的后门防御框架,仅利用良性样本来学习扩散轨迹的正常过渡动力学。 NDDL 构建紧凑的多空间轨迹表示并训练时间步条件动力学模型来预测扩散演化。在推理阶段,利用观察到的转换和预测的转换之间的偏差来量化后门检测的动态不一致。 NDDL 通过使用低语义词进行替换,进一步实现触发本地化,而无需事先了解嵌入式后门。针对不同后门攻击的大量实验证明了我们提出的 NDDL 的有效性和通用性。