论文

MuseBench:MLLM 中意图级视听艺术理解的基准测试

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

模型评测基准与评测资源

摘要

视听艺术涵盖多种创意学科,包括电影、视觉艺术、舞台表演和游戏设计,其中艺术意义源自视觉、听觉和叙事元素的故意组合(例如,通过幽闭恐怖的框架放大恐惧,或通过沉默和挥之不去的特写镜头传达悲伤)。真正的艺术理解不仅限于识别所描绘的内容,还包括推理为什么要通过特定的创造性选择来表达它。尽管多模态 大语言模型 (MLLM) 取得了巨大进展,但艺术理解的这一关键方面仍未得到充分探索,因为现有基准主要衡量感知识别,而忽视了对创意意图的推理。为了弥补这一差距,我们推出了 Musebench,这是一个综合基准,旨在评估 MLLM 对艺术理解的细致入微。它包含 4,016 个问题,涵盖电影艺术、静态视觉艺术、舞台表演艺术和游戏艺术,从超过 10,000 篇候选视频论文中提炼出来,将专业评论与视觉演示相结合。为了捕捉大规模艺术分析的开放性本质,该基准结合了单选问题和可变选项多选问题。所有问题都是通过结合捷径过滤、对抗性干扰因素和专家验证的四阶段迭代管道生成和完善的。对 28 个最先进的 MLLM 进行全面的零样本评估表明,即使是性能最好的模型也只能达到 48.29% 的准确率,远低于人类专家 87.18% 的表现,暴露出当前模型在创意领域专业知识方面的巨大差距。