论文

超越小补丁:黑盒检测和净化各种后门触发器

Beyond Small Patches: Black-Box Detection and Purification of Diverse Backdoor Triggers

AI 基础设施AI安全与内容治理基础设施

摘要

深度神经网络 (DNN) 越来越多地部署在现实世界的视觉系统中,但它们的预测可能会被后门攻击秘密操纵,其中恶意触发会导致有针对性的错误分类,同时保持较高的准确率。现有的防御措施通常依赖于模型内部结构、训练数据或干净的验证样本,这使得当只能对经过训练的模型进行黑盒访问时,它们很难部署。我们提出 TRIM(通过识别操纵区域来删除触发器),这是一种面向部署的黑盒防御,可以在推理时检测并选择性地删除后门触发器,而无需模型内部结构、训练数据或干净样本。 TRIM 背​​后的关键见解是识别导致异常模型行为的图像区域,并仅净化这些区域,同时保留良性内容。 TRIM 通过三个关键组件进行创新:(i) 具有深度特征表示的基于区域的分割,(ii) 通过修复和基于扩散的重建来自适应触发发现,以隔离导致错误分类的区域,无需对触发类型、形状或位置进行假设,以及 (iii) 选择性区域净化,在保留良性内容的同时清除中毒区域。为了支持实际部署,TRIM 进一步缓存先前识别的触发器的特征嵌入,从而实现高效识别并避免冗余检测和纯化。跨不同数据集和后门类型(包括混合、稀疏、变化大小和多个触发器)的广泛实验表明,TRIM 始终优于现有的黑盒防御,将攻击成功率 (ASR) 降低至低至 1.16%,同时保持高达 87.87% 的准确率。这些结果表明,即使防御者无法访问任何辅助数据,在推理时也可以有效地缓解后门。