论文

VidOmni-Bench:通过跨复杂性和持续时间的时空事件验证进行细粒度视频理解的基准

VidOmni-Bench: A Benchmark for Fine-Grained Video Understanding via Spatio-Temporal Event Verification across Complexity and Duration

模型评测基准与评测资源

摘要

虽然视频大语言模型(Video-LLM)最近表现出了强大的性能,但可靠地评估其细粒度视频理解仍然具有挑战性。现有的基准通常依赖于问题回答或真实标题匹配,其中模型可能通过肤浅的线索和不完整的注释取得成功。为此,我们引入了 VidOmni-Bench,这是一个基准测试,需要模型验证视频是否支持密集视频字幕中的每个事件。 VidOmni-Bench 包含 500 个视频,涵盖五种复杂程度,持续时间从 4 秒到 90 分钟不等。沿着这些轴收集视频后,我们使用不同的视频大语言模型来生成密集的字幕并获得经过人类验证的句子级标签,其中包含不正确事件的句子作为评估的硬底片。我们在 VidOmni-Bench 上的实验揭示了三个关键发现:(i)视频大语言模型经常在密集的视频字幕中生成幻觉描述; (ii) 他们作为验证者也很困难,无法可靠地检测看似合理但不正确的事件描述; (iii) 模型的弱点因视频复杂性和持续时间而异,揭示了当前视频大语言模型中不同的、特定于模型的瓶颈。