论文

LongVQUBench:视觉语言模型的长期视频质量理解基准测试

LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models

模型评测基准与评测资源

摘要

对于大型视觉语言模型(LVLM)来说,长期视频质量理解的评估仍然是一个开放的挑战。现有的视频质量基准主要关注短片和孤立的失真,忽视了长时间内容固有的时间连续性、累积退化和推理复杂性。为了解决这些限制,我们推出了 LongVQUBench,这是一个用于长期视频质量理解的综合基准。 LongVQUBench 包含 1200 多个不同的视频,涵盖电影、纪录片、监控录像、以自我为中心的录音和动画内容,并附有 1500 个用于验证和测试的多项选择和开放式问题。为了评估不同时间范围内的感知推理,我们引入了三个逐渐复杂的评估级别:(i)用于分析局部扭曲的局部事件质量理解(LQU); (ii) 用于整合多个降级事件的跨事件质量推理(CQR); (iii) 用于长期整体感知评估的全局质量理解 (GQU)。此外,针形扭曲问答(NDQA)范式嵌入在所有三个级别中,其中稀疏地插入空间或时间伪影以探测细粒度的检测和推理能力。对 14 个最先进的 LVLM 进行的大量实验表明,随着视频长度和推理深度的增加,性能会显着下降,这凸显了它们的远程时间整合和感知归因能力有限。我们设想 LongVQUBench 是对 LVLM 的长期视频质量理解进行系统化、分层且可解释的评估的基础步骤。