论文
超越错误的权衡:用于隐形和通用 T2I 后门的自适应 EWC
Beyond the False Trade-off: Adaptive EWC for Stealthy and Generalizable T2I Backdoors
摘要
保持模型保真度对于隐秘的文本到图像 (T2I) 后门攻击至关重要。诸如“不忘初心”(LwF)之类的现有方法依赖于基于输出的 蒸馏,它提供了有限的正则化。我们引入弹性权重合并(EWC)作为基于参数的替代方案,以保持后门学习的保真度。虽然原则上更强,但我们表明,具有固定正则化权重 lambda 和均方效用损失的标准静态 EWC 在攻击成功率 (ASR) 和保真度之间创建了人为的权衡,特别是在弱触发时降低了性能。为了解决这个问题,我们提出了 Cosine-Aware Adaptive EWC,它使用基于余弦的语义实用程序和自适应调度来动态调整 EWC 正则化。这种方法将 EWC 从固定惩罚转变为上下文敏感约束,在保持高 ASR 的同时保持模型保真度。实验证明,与现有基线相比,域外 (OOD) 数据集的 ASR 保真度平衡得到了改善,鲁棒性也得到了增强。