论文

DiaVLo:视觉语言模型的诊断行为

DiaVLo: Diagnosing Behaviours of Vision-Language Models

模型评测评测方法与指标

摘要

视觉语言模型 (VLM) 依赖于在其子组件之间存储和传输适当的信息。验证 VLM 是否表现出所需的行为,同时避免有害的行为,是其可靠部署的核心。然而,识别 VLM 行为的方法仍然很少。我们提出了 DiaVLo,一个诊断框架,它利用人工管理和 VLM 的生成能力来构建期望和观察到的 VLM 行为的规范,从而发现潜在的偏差。除此之外,DiaVLo 还提供因果估计,以确定指导 VLM 行为的最有影响力的概念。我们在分类和生成条件下在几个开源 VLM 上评估 DiaVLo。我们的实验表明,DiaVLo 生成与模型性能相关的行为标签,并为测量的性能提供上下文。 DiaVLo 表现出明显一致和不一致的行为,以及 VLM 如何感知、组织和优先考虑概念的模式。