论文
看见时间:视觉语言模型中时序推理与捷径偏见的基准
Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models
摘要
视觉语言模型 (VLM) 的最新进展显着增强了它们解释复杂视觉语义的能力,但它们的时间推理能力仍未得到充分探索。在本文中,我们介绍了一种新颖的基准,专门用于评估 VLM 如何感知和推理图像内部和图像之间的时间顺序信息。与现有的专注于帧排序的基于视频的基准不同,我们的工作深入研究了时间顺序判断的基本逻辑以及向多模态集成的扩展。为了实现这一点,我们构建了三个专门的数据集:一个包含跨越较长历史持续时间的视觉上相似的对象,另一个按不同的事件和对象类型进行分类,第三个将图像与时间敏感的新闻文本配对以进行跨模式对齐。通过大量的实验,我们分析了模型是否表现出跨类别的性能差异,最重要的是,探索它们是否依赖于“不正确的捷径”,例如图像颜色而不是真正的时间顺序特征。我们的结果表明,虽然 VLM 显示出前景,但它们经常利用灰度与彩色滤光片等表面线索来绕过真实的时间顺序推理。通过提供这些高质量的数据集和严格的评估框架,我们提供了一个诊断工具来识别当前的局限性并指导开发更强大、更有逻辑基础的多模态模型。源代码见https://github.com/LuoRenqiang/ChronoVision。
