论文
CulMind:中国文化遗产多模态理解与推理的基准测试
CulMind: Benchmarking Multimodal Understanding and Reasoning in Chinese Cultural Heritage
摘要
评估中国文化遗产 (CCH) 中的多模态 大语言模型 (MLLM) 需要对视觉、文本、风格和历史线索进行细粒度推理。然而,现有的 CCH 基准主要强调最终答案的准确性,而推理过程的准确性和完整性尚未得到充分探索。为了解决这一差距,我们引入了 CulMind 和 CulMind-R:多模态 CCH 的高质量基准,涵盖来自 100 多个博物馆藏品的 50 项任务,以及一个 24 任务推理子集,可自适应地定义推理过程评估的任务特定维度。为了评估推理质量,我们提出了 ReaScore,这是一种任务自适应指标,通过自动加权任务相关维度来评估推理。对 14 个领先的 MLLM 进行的实验揭示了答案和推理之间存在巨大差距,尤其是在具有挑战性的任务上。进一步分析表明,任务自适应维度选择和加权可以更好地使评估结果与专家判断保持一致。总体而言,我们的基准和指标支持对 CCH 理解进行更加专家一致的评估,并为更广泛的文化遗产评估提供可转移的参考。我们在 https://github.com/ZevTsao/CulMind 公开发布数据、代码和评估脚本,以促进可重复的研究。