论文
SYNCR:具有综合基础的跨视频推理基准
SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding
摘要
多模态 大语言模型 (MLLM) 在单视频理解方面取得了快速进展,但它们跨多个独立视频流进行推理的能力仍然知之甚少。现有的多视频基准在很大程度上依赖于人类注释的真实世界镜头,限制了空间、时间和物理 真值 的精度,并且使得诊断模型故障变得困难。我们推出了 SYNCR,这是一种用于跨视频推理的受控合成基准,具有以编程方式验证的基础。 SYNCR 使用 Habitat、Kubric 和 CLEVRER 模拟器引擎构建,包含基于 4,827 个独特视频的 4,000 个多视频问答对。它跨八个任务评估 MLLM,涵盖四个诊断支柱:时间对齐、空间跟踪、比较推理和整体综合。我们对领先的开放权重和封闭权重 MLLM 的零样本评估揭示了当前模型与人类之间的巨大差距:最佳模型仅实现 64.5% 的平均准确度,而人类基线的平均准确度为 89.5%。模型在时间排序方面表现相对较好,但在精确的物理和空间推理方面存在困难,最好的模型在运动学比较方面仅达到 29.8% 的准确度。我们进一步发现,参数缩放和推理专用的 后训练 提高了时间对齐能力,但不能可靠地解决细粒度物理跟踪或全局空间合成问题。最后,模拟与真实的相关性分析表明 SYNCR 在现实世界的多视频基准上跟踪模型级趋势。