论文

HAVEN:统一视频理解的分层对齐多模态基准

HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding

模型评测基准与评测资源

摘要

虽然多模态 大语言模型 (MLLM) 在标准视频任务上表现出强大的性能,但它们忠实地总结和推理复杂叙述的能力仍然缺乏评估。现有的摘要基准将监督分散到孤立的粒度上,例如关键帧、关键镜头或脱节的文本摘要,无法捕获跨模式对齐的固有层次结构。为了解决这一关键差距,我们引入了 HAVEN,这是一个用于统一视频理解的分层对齐的多模态基准。 HAVEN 开创了完全粒度(帧、镜头和视频级别)和完全多模态(视频和文本)数据集架构,并在模态之间具有明确、连续的对齐。基于这种统一的注释范式,我们提出了一个涵盖摘要、时间推理、多模态基础和显着性排名的综合评估套件。对最先进的 MLLM 的广泛基准测试暴露了表面文本流畅性和扎根的多模态理解之间持续存在的差距。最终,HAVEN 超越了传统的 QA 格式,推进了多模态系统的评估,提供了严格的标准化测试平台,以推动可解释的分层视频理解的未来研究。我们公开发布数据集、基准套件和评估协议。