论文

时间盲点:使用 CHRONOSIGHT 对视觉语言模型中的时间推理进行基准测试

Chronological Blindness: Benchmarking Temporal Reasoning in Vision-Language Models with CHRONOSIGHT

模型评测基准与评测资源

摘要

人类对视觉场景的感知本质上是暂时的。我们本能地识别出水果是否正在成熟或腐烂,建筑是否正在进行或正在拆除,以及同一主题的两张照片大约相隔多长时间。大型视觉语言模型(VLM)是否具有这种能力仍然是一个开放且实际重要的问题。我们引入了 CHRONOSIGHT,一个严格控制的基准,评估视觉时间推理的五个维度:CHRONORANK(图像序列的时间顺序)、CHRONOLOCATE(单个图像的顺序阶段定位)、CHRONODELTA(对数尺度上两个图像之间经过的时间估计)、CHRONOREVERSE(时间反转序列的检测)和 CHRONOODD(识别集合内的时间异常值)。该基准包括 8 个过程系列(生物生长、食物转化、物理风化、建筑、环境变化、人类衰老、天文现象和城市动态)的 1{,}000 个项目,时间跨度从几分钟到几千年。我们在两种提示机制下评估了八个开源 VLM(500 M 至 19 B 参数)并收集人类表现基线。各个任务的人类绩效平均为 0.89;最好的开放模型(Qwen2.5-VL-7B)在直接提示下达到0.40,我们将这个差距称为时间盲点。 151 个示例上的轻量级 LoRA 微调 将 CHRONODELTA 精度从接近零提高到 0.43,将零样本转移到相关任务(CHRONOODD:0.37;CHRONOREVERSE:0.64),这表明瓶颈部分是指令遵循而不是视觉感知。基准、代码和预测将在接受后发布。