论文
MMGist:2027 年综合多式联运基准
MMGist: A Comprehensive Multimodal Benchmark for 2027
摘要
我们对 18 个广泛使用的视觉语言基准进行了系统研究,发现了三个主要问题:1)许多项目不依赖视觉线索,因此无法有效衡量多模态理解; 2)当前LVLM的许多项目已经接近性能饱和,这限制了它们的判别能力; 3)少数异常项影响评价结果的可靠性。为此,我们提出了 MMGist,这是一个涵盖七个能力维度并包含 7,262 个项目的策划基准。 MMGist 通过三阶段管道构建,依次结合了文本消融过滤、跨模型饱和过滤和异常检测过滤。我们对 27 个领先的 LVLM 进行了广泛的实验,并将 MMGist 与包含 23,250 个项目的原始池进行比较。结果表明,MMGist 保留了高保真度的模型排名,Spearman $ρ= 0.98$,同时减少了 69\% 的评估项,提高了 78\% 的跨模型区分度。进一步的结果表明,视觉逻辑仍然是当前 LVLM 的系统弱点,而知识密集型维度(例如专家知识维度)仍然是区分闭源模型和开源模型的重要因素。这些发现表明,高质量的评估应优先考虑视觉依赖性、辨别力和可靠性,而不是简单地追求基准规模。