论文

超越基准:使用 VLM 揭示现实条件下的系统分类失败

Beyond Benchmarks: Using VLMs to Reveal Systematic Classification Failures Under Real World Conditions

模型评测评测方法与指标

摘要

分类模型的验证和确认 (V&V) 对于实现广泛的传感器处理应用至关重要。目前,V&V 流程依赖于对错误样本进行耗时的手动检查来寻找有意义的模式。这项工作探讨了如何使用视觉语言模型 (VLM) 来加速这一费力的过程。 VLM 经过训练,可以将图像嵌入到语义上有意义的向量表示中,从中可以提取出人类可解释的系统错误。在防御环境中部署这种基于 VLM 的方法会带来两个主要挑战:(1) 防御领域在 VLM 的训练数据中代表性不足,(2) 周围环境和背景的多样性不如其他领域。本研究对基于 VLM 的方法对于国防应用的 V&V 的适用性进行了初步评估。我们提出了一种基于 VLM 的错误切片检测 (ESD) 方法,该方法可以独立地对分类模型产生的系统错误进行分组和标记。我们证明该方法能够识别非军事数据集中与操作相关的人为添加的扰动。在军事背景下,我们的方法根据周围环境对图像进行聚类和描述,但也表现出聚类描述之间的重叠。我们进一步研究了军事和非军事数据集之间嵌入变化的差异,这仍然是一个令人感兴趣的话题。尽管结果还不能保证通过基于 VLM 的 ESD 实现完全自动化的 V&V,但它们表明 VLM 可以在未来用于加速 V&V 流程。