论文

VideoOdyssey:以连续观看需求衡量超长视频理解

VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding

模型评测基准与评测资源

摘要

长视频理解要求模型在很长的时间跨度中持续跟踪、整合信息并保留记忆。现有基准虽然增加视频时长,但问题往往只涉及短而孤立的片段,无法充分衡量超长上下文推理。研究采用连续观看时长(continuous certificate length)衡量认知负荷,即人类为明确回答一个问题必须连续观看的视频长度,并据此构建 VideoOdyssey 超长上下文、全模态视频理解基准。基准覆盖11个领域、54个子类,视频平均长109分钟;VideoOdyssey-V 测试多模态大语言模型的视觉理解,VideoOdyssey-AV 测试全模态模型的同步视听理解。两者平均连续观看需求分别为16分钟和12.8分钟,并设置从秒到小时的五个粒度等级,诊断不同上下文长度和认知负荷下的表现。评估显示,当前模型的困难不仅是检索,还包括持续推理、细粒度感知与非语言的全模态理解。