论文
从准确性到视觉依赖性:流量 VideoQA 中的审核和过滤模态崩溃
From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA
摘要
高基准准确性并不能保证视觉证据的真实使用。我们在交通事故视频问答(VideoQA)中研究这个问题,其中正确答案应该取决于特定场景的视觉证据,但也可以从文本快捷方式推断出来。通过对四个公共基准的审核,我们发现最近的几种开放权重视觉语言模型(VLM)在没有视频输入的情况下表现得很有竞争力,有时甚至更好。在 MM-AU 基准测试中,删除视频可以持续提高准确性,而添加更多帧会进一步降低性能。为了量化视觉依赖性,我们引入了两种数据集级诊断:盲间隙(测量纯文本性能的高概率)和视觉增益(测量添加视频的边际效益)。我们进一步提出了一个实例级快捷分数,它将纯文本置信度与视觉必要性信号相结合,从而能够对容易出现快捷方式的问题进行连续的 无需训练 过滤。由此产生的子集减少了捷径偏差并改善了视觉证据依赖。我们的研究结果揭示了不同基准的视觉证据依赖质量存在巨大差异,并表明视觉视觉证据依赖评估(而不仅仅是高精度)对于安全关键型 VideoQA 至关重要。