论文
Video-IFBench:评估视频理解场景中多模态 LLM 的指令跟踪
Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
摘要
多模态 大语言模型 (MLLM) 在视频理解方面表现出了强大的性能。然而,他们遵循该领域指示的能力仍有待探索。现实世界的视频理解不仅需要模型能够正确解释视频内容,而且还需要满足不同的用户指定的约束。现有的基准主要关注任务准确性而不是指令遵守情况,因此对这种能力的评估不充分。为了解决这一差距,我们引入了 Video-IFBench,这是一个用于评估视频理解中的指令遵循的综合基准,其中模型必须满足不同的用户指定的约束,包括基于视觉和音频内容的约束。我们开发了具有四个模板的指令分类法,包括单任务、多任务、选择和嵌套指令,涵盖 32 种任务类型和 39 个手动设计的约束类别,涵盖语义和格式要求。为了降低注释成本,我们构建了一个半自动数据构建管道,结合了 MLLM、编程处理和人工验证,产生了 1.5K 个样本。我们对 20 多个最近的 MLLM 进行了大规模评估,结果表明,视频指令跟踪对于当前模型来说仍然具有挑战性,特别是对于具有许多约束、语义约束或复杂条件结构的指令,需要根据视频内容选择正确的分支或路径。我们希望我们的工作能够促进未来在视频理解场景中遵循指令的研究。