论文

TOC-Bench:视频的时间对象一致性基准 大语言模型

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models

模型评测基准与评测资源

摘要

视频 大语言模型 (Video-LLM) 在一般视频理解方面取得了长足进步,但其维持时间对象一致性的能力仍未得到充分探索。现有的基准通常强调事件识别、动作理解或粗略时间推理,而很少测试模型是否可以在遮挡、消失、再现、状态转换和跨对象交互中保留同一对象的身份、状态和连续性。我们引入 TOC-Bench,这是一个用于评估 Video-LLM 中时间对象一致性的诊断基准。 TOC-Bench 以对象跟踪为基础:每个查询的主题都链接到每帧轨迹和结构化时间事件时间线。为了确保问题需要按时间顺序排列的视觉证据,而不是语言先验、单帧快捷方式或无序帧线索,我们设计了一个三层时间必要性过滤协议,该协议删除了 60.7% 的候选 QA 对,并在 10 个诊断维度中保留了 17,900 个时间相关项目。从这个池中,我们构建了一个经过人工验证的基准,其中包含 1,951 个视频中的 2,323 个高质量 QA 对。对代表性 Video-LLM 的实验表明,即使模型在一般视频理解基准上表现良好,时间对象一致性仍然是一个尚未解决的主要挑战,在事件计数、事件排序、身份敏感推理和幻觉感知验证方面存在明显的弱点。这些结果表明,以对象为中心的时间一致性是当前 Video-LLM 的关键瓶颈,并且 TOC-Bench 提供了一个用于诊断和改进对象感知时间推理的集中平台。该资源位于 https://github.com/cjzcjz666/toc_bench.git。