论文
大视觉语言模型中的偏转和幻觉基准测试
Benchmarking Deflection and Hallucination in Large Vision-Language Models
摘要
大型视觉语言模型 (LVLM) 越来越依赖检索来回答知识密集型多模态问题。现有的基准忽略了视觉和文本证据之间的冲突,以及当检索到的知识不完整时产生偏转(例如,抱歉,我无法回答......)的重要性。这些基准也很快就会过时,因为不断增长的 LVLM 训练集允许模型无需检索即可回答许多问题。我们通过三项贡献来解决这些差距。首先,我们提出了一个动态数据管理管道,通过过滤真正依赖于检索的样本,随着时间的推移保持基准难度。其次,我们介绍了 VLM-DeflectionBench,这是一个跨越不同多模态检索设置的 2,775 个样本的基准,旨在探讨证据冲突或不足的情况下的模型行为。第三,我们定义了一个细粒度的评估协议,其中包含四种场景,将参数记忆与检索鲁棒性分开。对 20 个最先进的 LVLM 进行的实验表明,在存在噪音或误导性证据的情况下,模型通常无法发生偏差。我们的结果强调,不仅需要评估模型知道什么,还要评估模型不知道时的行为方式,并作为可靠的 KB-VQA 评估的可重用和可扩展的基准。所有资源将在发布后公开。