论文
陪审团职责:文化模糊下 MLLM 作为法官的校准和定位失败
Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity
摘要
MLLM 作为法官通常通过与人类注释的一致性来验证,但当人类池具有文化异质性时,该指标是不确定的。我们引入了 VOIR DIRE,这是一个包含 626 个文化配对图像的多模态基准——跨越美国和中国大陆的食品、时尚和建筑领域的提示工件,其注释器池在池内可靠(a = 0.86/0.74),但在评估上存在跨池分歧(Q1 r = -0.12)。在六个 MLLM 中,偏差分解为两种失败:积极性底线校准失败(压缩尺度使用)和方向失败(默认为一种文化规范)。在这个语料库中,对有争议的项目进行抽样以划分两个池,地板自动验证更宽松的中文阅读;角色提示部分恢复了校准,但方向残差仍然存在,这证明倾斜不能简化为尺度压缩。参考池上下文演示加深了方向残差并夸大了高端,而不是恢复了低端的使用。模型原点添加了一个小的附加倾斜(~0.10 MAE),该倾斜在演示下近似不变。我们建议分别报告每个参考池的一致性,并将跨池差异视为判断属性。