论文

这不是图像所显示的那样:不相关的背景会在不通知 VLM 评审的情况下破坏他们的稳定性

It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them

模型评测鲁棒性、公平性与可信度评测

摘要

视觉语言模型 (VLM) 越来越多地用来代替人类注释者,因此可替代性测试反映模型而不是偶然的评估条件非常重要。我们介绍 MIST,即误导性图像压力测试:200 个英语句子,每个句子都围绕一个可以比喻或字面阅读的短语构建,并显示描述其阅读内容的对齐图像、描述相反的误导性图像或根本没有图像。该指南要求标签仅由句子决定,因此任何图像都不应改变任何答案。我们期望每张图片都能将评审的标签拉向它所描绘的感觉,但两种图片都没有。在 13 位 VLM 评委中,对齐的图像改变了 20.5% 的标签,误导性的图像改变了 19.4%,对于每位评委来说都很接近,并且都高于删除保留图像的忽略图像指令所产生的 11.6%。然而,只有 37% 的两幅图像之间存在差异的标签朝着所显示的含义移动,并且无论图像不存在、对齐还是具有误导性,与我们的人类注释者的一致性都不会改变。通过替代测试的七名评委的效果比从未通过替代测试的六名评委的影响要小,但在所有评委中都存在:令评委感动的是图像的存在,而不是它是两个中的哪一个,因此可替代性判决描述了一种配置,就像描述了一个模型一样。