论文
视觉语言人工智能模型十年来准确性和视觉认知错误的演变
Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models
摘要
过去十年中,视觉语言模型(VLM)在视觉推理方面取得了显着的进步。大多数评估都使用简单的场景(MS-COCO),不展示复杂的人类交互或行为,仅使用少数非策划的人类描述作为基准,并且没有专注于理解模型的错误类型。在这里,我们介绍复杂社会行为 (CSB) 数据集,其中包含 100 张描述复杂社交互动/行为的图像。我们分析了 VLM(四个前多模态 大语言模型、MLLM 和五个 MLLM)十年(2017-2025 年)场景描述的进展。我们评估了模型和 20 种人类描述相对于 CSB 数据集和 MS-COCO 样本的标准标注的准确性。我们分析了五种视觉认知错误类型:物体检测、识别、幻觉、场景理解和空间依赖。 CSB 数据集在场景描述准确性方面比 MS-COCO 有更显着的改进,预 MLLM 的准确度比排名垫底的人类描述低得多,而 MLLM 获得的准确度与排名靠前的人类描述相似。我们表明,MLLM 消除了更简单的 MS-COCO 场景和描述复杂行为的场景 (CSB) 之间场景描述准确性的差距。 MLLM 几乎消除了我们测试的数据集中的所有错误类型,除了偶尔依赖于与人类不同的图像区域进行场景描述(空间依赖性错误)。我们还表明,检测、识别和幻觉错误对场景描述准确性的影响最大。总之,我们的研究结果对视觉语言模型在过去十年中的进步提供了更全面的评估。