论文

当视觉语言模型不看图像便作评判:揭示信息量偏差

When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias

模型评测评测方法与指标

摘要

VLM-as-a-Judge的可靠性对视觉语言模型(VLM)的自动评估至关重要。尽管近期已有进展,我们的分析显示VLM-as-a-Judge在做决策时往往对图像关注有限。相反,它们常常盲目偏爱信息量更大的答案,即使它们能识别出该答案与图像内容相冲突。我们将这一问题称为信息量偏差(informativeness bias),它显著损害评判的可靠性。为解决这一问题,我们提出BIRCH(Balanced Informativeness and CoRrectness with a Truthful AnCHor),该评判范式先纠正候选答案中与图像内容不一致之处,再将各答案与纠正后的版本进行比较。这将评判者的关注点从信息量转移到基于图像的正确性上。在多个模型与基准上的实验表明,BIRCH将信息量偏差最多降低17%,带来最高9.8%的性能提升。我们的工作揭示了当前VLM-as-a-Judge系统中一个被忽视但根本性的缺陷,并强调需要更有原则的设计。

当视觉语言模型不看图像便作评判:揭示信息量偏差:论文配图
图 7:拟议 BIRCH 的图示。步骤1:根据图像对每个候选答案进行检查和纠正。在答案 B 中,不受支持的详细信息“Boeing 747”被替换为“商业客机”,并澄清为“无法确认确切型号”。第 2 步:将更正的答案合并到既真实又信息丰富的锚中(考生的所有详细信息都被更正或保留)。步骤3:将候选者与主播进行比较。这迫使法官专注于锚点中编码的图像内容,平衡信息性与正确性,并避免过度优先和过度惩罚信息性。