论文
目标对准是否意味着目标恢复?对比编码器对抗性主张的证据阶梯研究
Does Target Alignment Mean Target Recovery? An Evidence-Ladder Study of Adversarial Claims on Contrastive Encoders
摘要
对视觉语言模型的对抗性攻击会针对文本目标优化图像,然后引用受攻击模型的相似性分数作为成功的证据。我们询问该分数(受害者空间目标对齐(VTS))是否可以通过独立模型预测目标的恢复。我们首先构建一个测量工具:受攻击几何体之外的监督判断、真实目标混合控制、混洗目标底片以及从 50% 目标图像混合得出的参考水平。然后,两项预先注册的研究在三个扰动预算下的匹配攻击下比较了六个对比编码器。经过严格训练的编码器(FARE、TeCoA、PMG、TRADES)比普通 CLIP 或 SigLIP 传输更多的独立证据;所有八个对比都在引导层中被拒绝。然而,没有细胞达到混合衍生的参考水平。三个最好的细胞落在其复制带内,实际恢复情况尚未确定。在鲁棒编码器中,每个样本的对齐增益与证据增益相关($ρ= 0.24-0.51$);在普通 CLIP 中,相关性为零。 在编码器中,我们发现没有单调的对齐-证据关系。因此,VTS 仅在固定的鲁棒编码器内提供信息,并且我们提供报告协议来代替它。