论文
CLIPGuard:区域级黑盒后门检测与修复
Region-Level Black-Box Defense Against Stealthy Embedding-Space Backdoors in CLIP
摘要
对比语言——图像预训练(CLIP)由于其强大的可迁移性和零样本能力而成为主导视觉骨干。然而,最近的研究揭示了一个严重的漏洞:嵌入空间后门攻击。通过仅毒害一小部分图像-文本对,对手可以植入隐形触发器,从而引起 CLIP 联合嵌入空间的有针对性的变化。与操纵分类器logit的传统后门不同,这些攻击直接破坏表示,使其在极低的中毒率下非常有效并且难以检测。现有的防御需要访问模型参数、梯度、logit或干净的验证数据——这些假设在现实的黑盒部署中很少成立。此外,当前的黑盒方法很难准确定位小的或超出分布的触发器。我们提出 CLIPGuard,这是一种轻量级且完全黑盒的防御,专门设计用于减轻 CLIP 编码器中的嵌入空间后门。 CLIPGuard 通过测量分段嵌入扰动来识别恶意区域,并通过语义修复选择性地仅纯化可疑片段,从而保留良性视觉内容和对齐质量。对 STL-10、ImageNet 和各种触发器系列(包括 BadCLIP、BadNets、混合攻击、基于补丁的攻击和印刷攻击)的大量实验表明,CLIPGuard 将攻击成功率降低至低至 1.05%,同时保持高达 86.34% 的干净准确率,始终优于现有的黑盒防御,包括 CleanCLIP 和 CleanerCLIP。我们的代码可用 https://github.com/wsu-cyber-security-lab-ai/CLIPGuard.git
