论文

SYNCR:通过模拟诊断和学习跨视频推理

SYNCR: Diagnosing and Learning Cross-Video Reasoning from Simulation

模型评测基准与评测资源

摘要

跨视频推理需要对齐事件、匹配身份、比较运动以及整合部分观察结果。评估这些能力并测试如何改进它们需要可靠的标签和有针对性的监督。我们引入了 SYNCR,一个基于模拟器的框架,通过共享任务生成器连接这两种需求。 SYNCR 以 Habitat、Kubric 和 CLEVRER 为基础,从环境状态中得出答案,并针对不相交的视频提供 4,000 个评估问题和 15,960 个训练问题,涵盖八个跨视频推理任务。视觉消融和人工评估评估对所提供证据的依赖性和答案的可恢复性。对 22 个多模态大语言模型的评估揭示了物理比较和场景集成方面持续存在的困难,而增加模型大小并不能始终解决这些问题。监督微调将 Qwen3-VL-8B 的平均 SYNCR 准确度从 32.6% 提高到 61.6%,增益扩展到这些任务训练中缺少的任务配置和视频源。传输到真实镜头对于时间排序来说是最一致的:跨两个模型系列和两个模型大小的三个检查点构建的 Assembly101 和 Panoptic 排序集的准确性提高了 9.0-20.5 个百分点,并且在现有时间推理基准上还有额外的收益。这些结果将 SYNCR 确立为一种受控设置,用于诊断跨视频推理失败、测试其可学习性以及识别综合监督转移的位置。