论文

V-DyKnow:视觉语言模型时间敏感知识的动态基准

V-DyKnow: A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language Models

模型评测基准与评测资源

摘要

视觉语言模型(VLM)在文档(包括图像与文本)的数据快照上训练。其训练数据与评估基准通常是静态的,隐含地将事实知识视为不随时间变化。然而,现实世界的事实本质上具有时间敏感性,会经历无规律与周期性的变化,使模型预测变得过时。我们提出V-DyKnow,一个用于评估VLM中时间敏感事实知识的视觉动态知识基准。利用V-DyKnow,我们对闭源与开源VLM进行基准测试,并分析:a) 模型响应在各模态与输入扰动下的可靠性(正确性与一致性);b) 知识编辑与多模态RAG方法在各模态间知识更新上的效果;c) 借助数据与机理分析探究过时预测的来源。结果显示,VLM频繁输出过时事实,反映出(预)训练阶段所用快照已然陈旧。事实可靠性从文本刺激到视觉刺激逐步下降,即使实体被正确识别也是如此。此外,现有对齐方法无法在各模态间一致地更新模型知识。这些发现共同凸显了当前VLM在各模态间获取与更新时间敏感知识方面的根本局限。我们发布了基准、代码与评估数据。

V-DyKnow:视觉语言模型时间敏感知识的动态基准:论文配图
图 1:多模态查询 VLM 的示例,获取时间敏感的事实知识。受到视觉刺激后,VLM 首先会错误识别实体并检索到错误的事实。在对实体进行澄清之后,模型会生成一个过时的答案。在最后一轮中,实体在文本中明确陈述,最终返回正确的事实。这个例子强调了这项工作中研究的关键问题:VLM 中过时知识的普遍存在以及 VLM 在视觉和文本刺激方面的性能差距。