论文
ReACT-CLIP:视觉语言模型的响应感知测试时间防御
ReACT-CLIP: Response-Aware Test-Time Defense for Vision--Language Models
摘要
无需训练 测试时防御提供了一种实用的方法来提高 CLIP 式视觉语言模型的对抗鲁棒性,而无需修改预训练模型。然而,它们的校正强度通常针对较窄的攻击预算范围是固定的,即使攻击预算在推断时未知并且所需的校正因样本而异。我们表明,这种不匹配会导致现有的防御随着攻击的加强而急剧下降。我们引入了 ReACT-CLIP,一种以响应为条件的测试时防御,它分别确定每个输入的纠正强度以及防御干预是否必要。我们的主要观察结果是,低噪声和高噪声探针之间 CLIP 视觉特征漂移的相对增加为校正需求提供了分级的、特定于样本的代理。 ReACT-CLIP 将这种相对交叉噪声漂移映射到高斯噪声尺度,用于构建稳定的噪声平均特征锚,从而使校正范围能够适应每个输入。为了确定干预是否必要,我们进一步观察到干净的输入在弱空间增强下保持稳定的类别概率分布,而对抗性输入表现出更大的变化。 ReACT-CLIP 使用由 Jensen-Shannon 散度计算的预测不稳定得分来量化这种变化,并将其与相对交叉噪声漂移相结合以形成防御干预得分。 ReACT-CLIP 不需要模型或即时训练,其校正强度映射只需校准一次并在数据集和攻击预算中固定。在 12 个下游数据集以及 ImageNet 及其分布转移变体中,ReACT-CLIP 在不同的攻击类型和强度上提供了显着的鲁棒性增益,同时在很大程度上保持了干净的准确性。