论文
PerceptionBench:评估多模态中的原子视觉感知 大语言模型
PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models
摘要
我们推出 PerceptionBench,这是一个专门为评估 Multimodal 大语言模型 (MLLM) 的原子视觉感知能力而设计的基准。现有的基准通常无法隔离感知:整体评估将感知错误与推理或领域知识的失败混为一谈,而应用程序驱动的基准仅涵盖由启发式设计形成的狭窄、碎片化的领域。为了解决这些限制,PerceptionBench 采用了自下而上的方法:通过诊断 42 个现有基准中前沿 MLLM 响应中的最早故障点,我们构建了一个错误分类法,其感知分支定义了 10 个原子感知能力。在这种分类法的指导下,我们构建了 3,000 个经过验证的问题,并给出了简短、明确的答案,每个问题都隔离了一种能力,其困难源于感知而不是推理或知识。 16 个前沿 MLLM 的基准结果表明,原子感知在很大程度上仍未得到解决——没有模型达到 60% 的准确度,与感知相关的幻觉平均而言是最弱的能力,相似的总体分数掩盖了截然不同的能力概况。因此,PerceptionBench 为测量和诊断 MLLM 的视觉感知边界提供了能力级别标准。