论文
V-DyKnow:视觉语言模型时间敏感知识的动态基准
V-DyKnow: A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language Models
摘要
视觉语言模型(VLM)在文档(包括图像与文本)的数据快照上训练。其训练数据与评估基准通常是静态的,隐含地将事实知识视为不随时间变化。然而,现实世界的事实本质上具有时间敏感性,会经历无规律与周期性的变化,使模型预测变得过时。我们提出V-DyKnow,一个用于评估VLM中时间敏感事实知识的视觉动态知识基准。利用V-DyKnow,我们对闭源与开源VLM进行基准测试,并分析:a) 模型响应在各模态与输入扰动下的可靠性(正确性与一致性);b) 知识编辑与多模态RAG方法在各模态间知识更新上的效果;c) 借助数据与机理分析探究过时预测的来源。结果显示,VLM频繁输出过时事实,反映出(预)训练阶段所用快照已然陈旧。事实可靠性从文本刺激到视觉刺激逐步下降,即使实体被正确识别也是如此。此外,现有对齐方法无法在各模态间一致地更新模型知识。这些发现共同凸显了当前VLM在各模态间获取与更新时间敏感知识方面的根本局限。我们发布了基准、代码与评估数据。
