论文

PRISM-VLM:紧凑视觉语言模型的多轴判别基准

PRISM-VLM: A Multi-Axis Discriminative Benchmark for Compact Vision-Language Models

模型评测评测方法与指标

摘要

紧凑视觉语言模型 (VLM) 现在为越来越多的多模式应用提供支持。然而,用于比较它们的基准继承了以前沿为中心的设计:每个模型都被简化为单个精度数字,缩小了饱和套件上模型间的差距,并将模型压入较难套件的低分带中。我们引入了 PRISM-VLM,这是一种多轴判别基准,它沿着七个轴对每个项目进行评分,涵盖重复出现的故障模式(任务质量、行为鲁棒性和能力瓶颈),并将它们组合成一个 PScore,其中的项目是从 15 个公共基准中回收的。在过去两年的紧凑型 VLM 中,PScore 在项目级配对引导下比之前的单轴基准测试更可靠地分离模型对,并显示这些基准测试平均后的行为差异。即使是具有统计上无法区分的 PScore 的模型,在每轴轮廓上也会出现很大的差异,特别是在阿谀奉承方面,这几乎与单提示精度正交。我们将发布完整的管道、提示和每个项目的注释。