论文
迷失在翻译中:LVLM 法官是否会跨语言进行概括?
Lost in Translation: Do LVLM Judges Generalize Across Languages?
摘要
奖励模型等自动评估器在大型视觉语言模型 (LVLM) 的调整和评估中发挥着核心作用。尽管它们的重要性日益增加,但这些评估者几乎完全根据以英语为中心的基准进行评估,从而留下了这些评估者跨语言泛化能力如何的问题。为了回答这个问题,我们引入了 MM-JudgeBench,这是第一个用于多语言和多模式判断模型评估的大规模基准,其中包括跨越 25 种不同类型语言的超过 60K 成对偏好实例。 MM-JudgeBench 集成了两个互补的子集:扩展 VL-RewardBench 的通用视觉语言偏好评估子集,以及源自 OpenCQA 的以图表为中心的视觉文本推理子集,从而能够对不同设置下的奖励模型(即 LVLM 评委)进行系统分析。我们还发布了一个源自 MM-RewardBench 的多语言训练集,与我们的评估数据脱节,以支持领域适应。通过评估 22 个 LVLM(15 个开源的,7 个专有的),我们发现我们提议的基准中存在巨大的跨语言性能差异。我们的分析进一步表明,模型大小和架构对于多语言稳健性的预测效果很差,而且即使是最先进的 LVLM 法官也会在不同语言之间表现出不一致的行为。总之,这些发现暴露了当前奖励模型的基本局限性,并强调了开发可靠的自动化评估器的多语言、多模式基准的必要性。