论文

有证据支持的视频问答

Evidence-Backed Video Question Answering

模型评测基准与评测资源

摘要

当前视频 大语言模型(视频 LLM)在问答(QA)方面表现出色,但很大程度上作为黑匣子运行,提供文本答案,没有可验证的视觉定位依据。现有的可解释性工作依赖于文本原理或稀疏边界框,它们很难捕获复杂的视频动态,例如遮挡和非刚性变形。我们提出了证据支持的视频问答(E-VQA),这是一项新颖的任务,要求模型联合输出语义答案和精确的时空证据:时间片段和密集的跟踪对象分割掩码。为了支持这一点,我们引入了 ST-Evidence,这是第一个经过人类验证的判别性和生成性像素级视觉定位基准。对最先进模型的评估揭示了 QA 准确性和真实视觉感知之间的关键脱钩,而仅靠缩放无法弥合这种脱钩。为了解决这个问题,我们开发了可扩展的自动化生成管道来创建 ST-Evidence-Instruct,这是一个 160k 规模的数据集,将高级推理与细粒度基础联系起来。 微调 基于此数据的视频 LLM 比相应的尺寸匹配 UniPixel 基线(例如,7B 模型上的 +27.2 t-mean 和 +13.8 J&F)产生了显着的增益,为可解释的、有证据支持的视频理解建立了强大的基线。代码和数据可在 https://github.com/SalesforceAIResearch/EVQA 获取。