论文

视觉语言模型中的文化时代错误和时间推理

On the Cultural Anachronism and Temporal Reasoning in Vision Language Models

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 越来越多地应用于文化遗产材料,从数字档案到教育平台。这项工作确定了这些模型如何解释历史文物的一个基本问题。我们将这种现象定义为文化不合时宜,即使用与时间不相适应的概念、材料或文化框架来误解历史对象的倾向。为了量化这一现象,我们引入了视觉语言模型的时间错误基准 (TAB-VLM),这是一个包含 6 个类别的 600 个问题的数据集,旨在评估从史前到现代时期的 1,600 件印度文化文物的时间推理。对 10 个最先进模型的系统评估揭示了我们的基准的重大缺陷,即使是最好的模型 (GPT-5.2) 也只能达到 58.7% 的整体准确率。在不同的架构和规模中,性能差距仍然存在,这表明文化不合时宜代表了视觉人工智能系统的重大限制,无论模型大小如何。这些发现凸显了当前 VLM 能力与准确解释文化遗产材料的要求之间的差距,特别是对于训练数据中代表性不足的非西方视觉文化。我们的基准为增强与历史文物交互的多模式人工智能系统中的时间认知奠定了基础。数据集和代码可在我们的项目页面中找到。