论文
EG-VQA:利用时态证据对可验证视频问答进行基准测试
EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence
摘要
Video 大语言模型 (Video-LLM) 的最新进展在视频问答 (VideoQA) 方面取得了可喜的性能。然而,现有的基准主要是通过答案的正确性来评估的,而预测与相关视频证据的对应在很大程度上仍未得到检验。答案生成和证据理解之间的这种脱节促进了基于证据的视频问答基准(EG-VQA)的构建,这是一种开放式评估协议,其中每个 QA 对都明确注释有支持时间证据,因此需要联合推理和精确的证据定位。 EG-VQA 由 2,067 个视频和 11,838 个 QA 对组成,并带有细粒度的证据注释。为了评估预测证据,引入了基于证据的 F1 (EG-F1) 作为统一度量,联合测量针对 真值 证据的时间对齐和语义一致性。实验评估表明,即使是强大的专有模型也难以准确地预测其预测,从而暴露了答案正确性和忠实证据定位之间的根本差异。为了弥补这一差距,EG-Reasoner 被提出,这是一种经过显式监督训练的循证推理模型。开源模型实现了最先进的性能,其结果可与专有系统相媲美,特别是在反事实问题等推理密集型任务上观察到明显的收益。这些发现表明,仅靠扩展不足以实现强大的视频理解,而结构化证据监督对于开发更可靠和可解释的 VideoQA 系统至关重要。