论文
通过感知扰动和奖励建模减轻多模态 LLM-as-a-Judge 中的感知判断偏差
Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling
摘要
最近的多模态 大语言模型 表现出了强大的推理能力,但它们作为自动评估器的可靠性仍然受到一个严重弱点的限制:当视觉证据与文本提示发生冲突时,MLLM 法官倾向于奖励合理的叙述,而不是感知上正确的答案。我们识别并系统地分析这种现象,我们将其称为感知判断偏差。通过受控的视觉扰动,现有的多模式法官经常锚定响应文本而不是他们自己的视觉感知,从而导致不一致和不可验证的评估。为了解决这个问题,我们引入了感知扰动判断数据集,该数据集构建了经过最少编辑的反事实响应,以隔离感知错误并实现可验证的监督。在此数据集的基础上,我们开发了一个统一的训练框架,将基于 GRPO 的结构化奖励与批量排名目标相结合,无需显式的成对标签即可实现连贯的全局排序。跨不同 MLLM-as-a-Judge 基准的实验表明,我们的方法大大提高了感知保真度、排名一致性以及与人类评估的一致性。我们的结果建立了一条可扩展且可推广的途径,用于训练多模式法官,这些法官具有感知基础、可解释且对视觉推理冲突具有鲁棒性。