论文

MM-JudgeBias:评估 MLLM 作为法官的构成偏差的基准

MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 已越来越多地用作自动评估器 - 一种称为 MLLM 作为法官的范式。然而,它们的可靠性和易受偏见的影响仍未得到充分研究。我们发现,许多 MLLM 法官未能可靠地整合关键视觉或文本线索,在证据缺失或不匹配时产生不可靠的评估,并在语义不相关的扰动下表现出不稳定。为了解决这个问题,我们系统地定义了 MLLM-as-a-Judge 系统中的成分偏差,并引入了评估它的基准 MM-JudgeBias。 MM-JudgeBias 引入了跨查询、图像和响应的受控扰动,并通过两个互补指标评估模型行为:用于敏感性的偏差-偏差 (BD) 和用于稳定性的偏差-一致性 (BC)。我们的数据集包含超过 1,800 个精心策划和精炼的多模态样本,这些样本取自 29 个源基准,可以对不同任务和领域的九种偏差类型进行细粒度诊断。对 26 个最先进的 MLLM 进行的实验揭示了系统模态忽视和不对称评估倾向,强调需要更可靠的法官。