论文

柏拉图式防御:大规模时代自监督编码器的后门防御 预训练

The Platonic Defense: Backdoor Defense for Self-Supervised Encoders in the Era of Large Scale Pre-training

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

自监督学习(SSL)预训练模型已成为视觉表示学习的主导范例,但它们很容易受到后门攻击。现有的防御措施很难在完全黑盒的设置中防御此类攻击,因为它们通常需要访问标签、攻击模式或训练数据。为了解决这个问题,我们提出了一种新的攻击不可知、模型不可知和模态不可知的黑盒测试时防御范式,称为 \emph{柏拉图表示防御}。它受到柏拉图表示假说的启发,该假说表明大规模独立训练的编码器会趋向于同一底层现实的兼容投影。我们将这个想法形式化为在源表示和一组参考表示上定义的条件能量函数。能量函数经过训练,用于通过噪声对比估计进行检测,并通过去噪分数匹配进行表示纯化。理论上,匹配和不匹配样本之间的能隙由源表示和参考表示之间的互信息限制。我们在多个自监督编码器和超过 10 次攻击中证明了我们的方法的有效性。该方法可以执行表示检测和净化,并在多次攻击中实现显着的性能提升。代码可在 \href{https://github.com/jsrdcht/Platonic-Representation-Defense}{here} 获取。