论文
通过 无需训练 概念本地化实现抵御印刷攻击的鲁棒性
Towards Robustness against Typographic Attack with Training-free Concept Localization
摘要
通过对比语言图像预训练 (CLIP) 训练的模型可作为大多数现代大视觉语言模型 (LVLM) 的基础视觉编码器。尽管得到广泛采用,CLIP 模型仍表现出一种关键但尚未充分探索的失败模式:图像中出现的不相关文本会混淆视觉表示,使它们偏向词汇意义而不是真正的视觉语义。这种鲁棒性问题通常被称为印刷攻击 (TA),它暴露了一个漏洞,该漏洞会给自动驾驶等安全关键型应用带来重大风险。为了实现针对 TA 的可解释且有效的鲁棒性,我们提出了一种新颖的 无需训练 机械可解释性方法。我们的方法提供了基于采样的隐藏状态表示解释,并定量地将语义与词汇焦点归因于个体注意头。通过概率分析和电路挖掘,我们分离出不成比例地编码词汇信息的特定 Vision Transformer (ViT) 组件,从而识别 TA 的机制来源。我们进一步表明,直接应用于识别的电路的简单干预,无需任何额外的训练,可以大大提高对象分类中针对印刷攻击的鲁棒性。这些干预措施(例如选择性调整注意力权重)也优于监督方法和 无需训练 防御方法。我们的实验表明,将所提出的干预措施应用于几个最先进的 LVLM 的视觉编码器,可以在 RIO-Bench 上的印刷攻击干扰下显着提高视觉问答的准确性。这些结果证实了我们的机械方法的有效性和普遍性。代码发布于 https://github.com/Liu-524/SamplingTAR。