论文

DEFUSE:具有生成先验的自监督编码器的可推广后门防御

DEFUSE: Generalizable Backdoor Defense for Self-Supervised Encoders with Generative Priors

AI 基础设施AI安全与内容治理基础设施

摘要

自监督学习 (SSL) 编码器容易受到后门攻击,对视觉 SSL 编码器和视觉语言编码器都构成威胁。现有的防御措施通常仅针对这些范例之一而设计,并且依赖于限制性假设,例如访问未受感染的分布数据或预先计算的伪标签,这些在实践中很难满足。为了解决这些限制,我们提出了 DEFUSE,一种用于 SSL 编码器的通用后门检测框架。受贝叶斯后验推理的启发,我们将后门检测重新表述为由条件扩散生成模型参数化的表示条件图像似然估计问题。未受感染的表示往往会产生语义一致的重建,而后门的表示更有可能映射到攻击者的目标类或语义上无意义的图像,偏离原始语义,从而暴露后门。然而,我们发现确切的可能性是棘手的,因为高度抽象的表示丢弃了像素忠实重建所需的底层信息。因此,我们放宽了语义重建的目标,并在参考编码器提供的分离良好的表示空间中对其进行评估。我们不是从头开始训练,而是微调预训练的扩散模型,利用其生成之前将数据映射到自然图像流形,同时保留语义内容。大量实验表明,DEFUSE 在不同的攻击设置中显着优于现有检测器,并推广到视觉 SSL 和视觉语言编码器。值得注意的是,我们的方法大大减少了对有关受害者编码器或攻击策略的先验知识的依赖。源代码可在 https://github.com/jsrdcht/DEFUSE 获取。