论文

CArtBench:评估中国艺术理解、解释和真实性的视觉语言模型

CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity

模型评测基准与评测资源

摘要

我们推出了 CARTBENCH,这是一个基于博物馆的基准,用于评估中国艺术品的视觉语言模型 (VLM),超越简短的识别和质量保证。 CARTBENCH 包括四个子任务:CURATORQA(基于证据的识别和推理)、CATALOGCAPTION(结构化四部分专家式欣赏)、REINTERPRET(通过专家评级进行合理的重新解释)以及 CONNOISSEURPAIRS(在视觉相似的混杂条件下诊断真实性辨别)。 CARTBENCH 是通过将维基数据中带有图像的故宫博物院物品与权威目录页面对齐而构建的,涵盖多个朝代的五个艺术类别。在九个有代表性的 VLM 中,我们发现较高的整体 CURATORQA 准确性可以掩盖硬证据链接和风格到时期推断的急剧下降;长篇鉴赏与专家参考还相去甚远;以真实性为导向的诊断歧视仍然接近偶然,这凸显了当前模型的行家级推理的难度。