论文

本地视频理解是否会在遭遇中转移? EgoGears 基准

Does Local Video Understanding Transfer Across Encounters? The EgoGears Benchmark

模型评测基准与评测资源

摘要

尽管视点、运动和照明发生变化,具身系统必须使在一次遭遇中获得的知识可在另一次遭遇中使用。然而,跨视频的总体准确性将局部感知的失败与保留观察身份、建立对应关系和形成证据的失败混为一谈,从而模糊了本地视频理解是否真正转移。我们推出了 EgoGears,这是一个互补的单视频和多视频基准测试,旨在诊断这种转变。它包含 567 个单视频和 1,487 个多视频问题,这些问题源自人类收集的 126 个自我中心记录,覆盖 39 条户外路线。重复遍历移动速度和照明条件,在共享物理环境中进行地面比较; 531 个问题需要跨独立录音进行对齐。单视频问题衡量模型可用的局部视觉、空间和运动证据,而多视频问题则测试证据是否仍然与正确的观察相联系,并且可以组成一致的路线关系。我们在主要排行榜中报告了六个模型系列的 29 个单视频和 31 个多视频 MLLM 配置。在两个分组上进行比较评估的 20 个配置中,每个模型在多视频问题上的表现都较差,平均下降了 22.5 个百分点,并且当答案格式和评分保持固定时,差距仍然存在。这种差距不能简单地用额外的视频或录制边界来解释。中心瓶颈是观察——证据绑定和有序的路线状态跟踪。代码和基准可在 https://github.com/lei-qi-233/EgoGears. 上公开获取