论文
OVIBench:中断下在线视频问答的基准测试
OVIBench: Benchmarking Online Video Question Answering under Interruption
摘要
最近的视觉语言模型(VLM)在视频理解方面取得了长足的进步。然而,大多数现有的视频 QA 研究和基准测试仍然遵循离线、单轮范例,忽略了用户可能在答案生成过程中中断模型的现实交互。为了弥补这一差距,我们制定了中断下的在线视频问答任务,并引入了 OVIBench,这是在这种情况下评估 VLM 的第一个标准化基准。 OVIBench 将中断分为三种类型:取消、错误触发、纠正,并支持开放式评估和多项选择评估。为了实现大规模和可重复的测试,我们开发了一个离线模拟协议,可以在统一的时间设置下重现生成过程中的中断,以及用于评估中断理解和响应生成的多维度量套件。实验表明,OVIBench 可以有效地区分模型的中断处理能力,尤其是在后续纠正请求方面。最后,我们构建了一个用于中断感知 微调 的训练集 OVI-Train。在此数据集上微调的模型在 OVIBench 上取得了显着的进步,验证了我们的基准测试和数据设计的有效性。 OVIBench、OVI-Train以及评估代码即将发布。