论文

Video-MME-Logical:视频时态逻辑推理的受控诊断基准

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

模型评测基准与评测资源

摘要

最近对多模态 大语言模型 (MLLM) 的兴趣提出了一个核心问题:它们能否对动态视觉证据进行推理,而不仅仅是识别单个帧中的对象或事件?这种能力,我们称之为视频时间逻辑推理,需要模型在视觉状态跨帧演变时维护、更新和组合证据。现有的视频基准测试通常将此功能与场景复杂性、静态识别或不受控制的时间变化混为一谈。为了隔离此功能,我们引入了 Video-MME-Logical,这是一个围绕五个时间逻辑操作组织的受控基准:状态跟踪、顺序计数、时间排序、动态空间性和结构组成。该基准测试包含 25 个细粒度任务类别,这些任务类别是通过受控对象状态、转换、时间依赖性和逻辑组合生成的。它通过改变时间范围和推理复杂性来实现难度控制的最终答案评估,并通过在生成最终答案之前验证模型是否恢复所需的逻辑推理轨迹来支持中间状态诊断。使用最先进的 MLLM 进行的实验揭示了人类模型之间存在巨大差距,尤其是随着时间逻辑复杂性的增加。对多达 500K 生成样本进行监督 微调 提高了性能,但仍不足以缩小推理差距,将 Video-MME-Logical 定位为用于分析和改进 MLLM 中的时间逻辑推理的可扩展测试平台。