论文
超越标准基准:视觉语言模型对不同任务中自然语义变化的稳健性的系统审核
Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks
摘要
在网络规模的图像文本对上训练的视觉语言模型(VLM)的最新进展已经在各种视觉任务中实现了令人印象深刻的零样本传输。然而,超越标准基准的全面、独立的评估对于了解其稳健性、局限性和现实世界的适用性至关重要。本文提出了一种在自然对抗场景下针对不同下游任务的 VLM 的系统评估框架,这在之前的评估工作中被忽视了。我们在精心策划的对抗数据集(印刷攻击、ImageNet-A 和自然语言引发的对抗示例)上评估了各种 VLM(CLIP、鲁棒 CLIP、BLIP2 和 SigLIP2)。我们测量了所选 VLM 在零样本图像分类、语义分割和视觉问答方面的自然对抗性能。我们的分析表明,强大的 CLIP 模型可以放大自然对抗性漏洞,并且 CLIP 模型会显着降低自然语言引发的对抗性示例的性能。此外,我们还提供可解释的分析来识别故障模式。我们希望我们的研究结果能够启发未来稳健且公平的多模态模式识别的研究。