论文
MLLM 评委会评判编辑吗?具有经过验证的质量保存的图像编辑评估中的审核偏差
Do MLLM Judges Judge the Edit? Auditing Bias in Image Editing Evaluation with Verified Quality Preservation
摘要
多模态大语言模型 (MLLM) 越来越多地用作基于指令的图像编辑的自动判断以及模型训练的奖励信号。然而,系统地审核这些评审是否受到与编辑质量无关的线索的影响是具有挑战性的,因为视觉干预本身可能会改变所评估的质量。因此,只有当干预措施得到验证以保持潜在的编辑质量时,判断的转变才能归因于偏见。为了应对这一挑战,我们引入了 EditJudgeBias,这是一个经过验证的质量保存的反事实基准,包含 1,196 个真实编辑样本和跨四个评估站点注入的 13 个提示。我们使用校准的多模态验证器、控制和人工检查来验证所请求编辑的质量保存。然后,我们从三个互补的维度审核五名 MLLM 评审:质量保持线索的不变性、与人类判断的一致性以及成对偏好的稳定性。重要的是,观察到的变化是根据每个评审自己的零剂量和重新查询本底噪声而不是零来评估的。实验表明,保证质量的线索可以让每个评委超越自己的噪音。捏造的多数意见会提高评分,不相关的视觉元素会导致比整个图像操作更大的变化,而交换候选顺序会逆转高达 60.9% 的成对决策。编辑区域提示也往往会降低人类的一致性。这三种衡量标准以不同的方式描述评审的特征,表明单一指标无法衡量鲁棒性。