论文

MLLM 作为法官表现出模型偏好偏差

MLLM-as-a-Judge Exhibits Model Preference Bias

模型评测评测方法与指标

摘要

使用多模态 大语言模型 (MLLM) 进行自动评估(通常称为 MLLM-as-a-Judge)已被广泛用于衡量模型性能。如果这种 MLLM 作为法官的方法存在偏见,它们可能会扭曲模型比较和基准驱动的科学进步。然而,目前尚不清楚 MLLM 作为法官的方法在多大程度上支持或不支持特定 MLLM 生成的文本。在本研究中,我们提出 Philautia-Eval 来研究这种模型特定的偏好偏差。 Philautia-Eval 通过将偏好倾向与生成质量差异分开来量化偏差程度。使用从 12 个 MLLM 收集的 129 万个图像描述—评分对,我们发现代表性的 MLLM 往往表现出自我偏好偏差。此外,实验结果表明特定模型系列内的相互偏好偏差,这可能是由重用连接器和重叠指令调整资源驱动的。最后,我们介绍一个简单的 MLLM 集成,Pomms。我们的结果表明,Pomms 有效地减轻了模型特定的偏好偏差,同时保持了性能。