论文
当视觉语言模型不看图像便作评判:揭示信息量偏差
When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias
摘要
VLM-as-a-Judge的可靠性对视觉语言模型(VLM)的自动评估至关重要。尽管近期已有进展,我们的分析显示VLM-as-a-Judge在做决策时往往对图像关注有限。相反,它们常常盲目偏爱信息量更大的答案,即使它们能识别出该答案与图像内容相冲突。我们将这一问题称为信息量偏差(informativeness bias),它显著损害评判的可靠性。为解决这一问题,我们提出BIRCH(Balanced Informativeness and CoRrectness with a Truthful AnCHor),该评判范式先纠正候选答案中与图像内容不一致之处,再将各答案与纠正后的版本进行比较。这将评判者的关注点从信息量转移到基于图像的正确性上。在多个模型与基准上的实验表明,BIRCH将信息量偏差最多降低17%,带来最高9.8%的性能提升。我们的工作揭示了当前VLM-as-a-Judge系统中一个被忽视但根本性的缺陷,并强调需要更有原则的设计。
