论文

ChinaHeritaQA:基于文化的中国世界遗产视觉问答数据集

ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China

模型评测基准与评测资源

摘要

我们引入了 ChinaHeritaQA,这是一个多模态基准数据集,用于评估中国联合国教科文组织世界遗产地视觉语言模型(VLM)的文化推理能力。该数据集包含 2,279 张野外图像,以及 14,133 个双语(中文/英文)多项选择 QA 对,涵盖七个认知维度,从基本身份识别到历史分期和架构分析。该数据集以联合国教科文组织一致的遗产本体论为指导,并通过严格的人工注释进行验证,确保了语言质量和事实一致性。对最先进的 VLM 的评估表明,虽然顶级模型的平均表现超过了人类,但任务级别的差异却出现了巨大的变化:模型擅长视觉识别,但难以进行基于文化的推理。表现也因王朝和地区而异。 ChinaHeritaQA 表明,强大的视觉检索并不能延伸到文化和历史的理解。我们发布该数据集是为了支持未来对文化意识多模式学习的研究。