论文

MMArt:用于视觉艺术理解的多视角多模态数据集

MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding

模型训练合成数据

摘要

最近的视觉语言模型展示了令人印象深刻的一般视觉理解,但它们的艺术解释仍然肤浅:它们描述表面内容,但在形式分析、扎根的历史解释或情感表征方面遇到困难。我们认为这不仅是一个模型,也是一个数据集的限制。现有的艺术数据集是单一视角资源,没有数据集能够同时为同一件艺术品提供叙事、形式、情感和历史视角。我们引入了 MMArt,这是一个包含 74,234 幅 WikiArt 绘画的大型数据集,每幅都用四个独立注释的视角加上统一的标题进行注释,由专门的视觉语言模型或人类注释生成,并通过补充质量评估进行验证。两项互补性分析表明,观点编码了真正不同的信息。生成分析表明,形式分析描述最好地保留构图风格,而历史描述在重建图像中携带强烈的情感信号。判别性检索分析揭示了任务不对称性:叙述性描述驱动检索(R@1 = 44.0%),而形式描述(最适合重建)在检索规模上几乎没有区别(R@1 = 7.8%)。留一法分析进一步证实,历史描述是这两项任务中最不可替代的视角。两项分析共同表明,没有单一视角能够满足所有任务,直接激发了 MMArt 多视角设计。数据集、代码和其他信息可在 https://shuaiwang97.github.io/MMArt/ 获取。