论文

迈向MLLM免标注验证:视觉-语言逻辑一致性度量

Towards Annotation-Free Validation of MLLMs: A Vision-Language Logical Consistency Metric

模型评测评测方法与指标

摘要

主导准确性评估可能会奖励对大语言模型的无根据猜测,并且它可能不适用于没有地面实况(gt)注释的模型验证的新任务。基于基本逻辑原理,我们提出了一种新颖的框架来评估 MLLM 在充分必要因果关系上的视觉语言逻辑一致性。我们在传统的 MC-VQA 测试和最近的 NaturalBench 测试上定义了视觉语言逻辑一致性度量 (VL-LCM),无需 gt 注释。通过对代表性 VL 基准 MMMU 和最近的 VL 挑战(例如 NaturalBench)进行系统实验,我们评估了来自 4 个前沿系列的 11 个最新开源 MLLM。我们的研究结果表明,尽管最近 MLLM 在准确性方面取得了重大进展,但逻辑一致性却明显落后。对 VL-LCM 与 gt 指标的相关性、LCM 的可靠性以及 VL-LCM 与响应分布的关系的广泛评估证明了 VL-LCM 的有效性和适用性,即使没有 gt 注释。我们的研究结果表明,除了准确性之外,还可以采用逻辑一致性来提高准确性和可靠性。 VL-LCM 还可用于在没有 gt 注释的新颖任务中进行 MLLM 选择、验证和可靠的答案论证。

迈向MLLM免标注验证:视觉-语言逻辑一致性度量:论文配图
图 1:我们在典型 MC 格式(例如 MMMU)和最新 NaturalBench 格式上计算 VL-LCM 的方法的图示。左侧上半部分显示正常的 MC-VQA 测试和概率预测。在下半部分,MC 问题被分成一组是/否 (YN) 测试,每个选择的联合概率是根据 MLLM 的预测获得的。最后,根据 MC 和 YN 测试计算 VL-LCM。右侧的上半部分显示了对 NaturalBench 中定义的四个图像-问题对的 YN 测试。下半部分说明了从 NaturalBench 格式导出的 MC 测试,其中每个具有两个文本表达式的图像(上图)以及每个具有两个图像的文本表达式都被馈送到 MLLM 以选择正确的一个。 VL-LCM 是根据 YN 和 MC 测试的一致性计算的。