论文

EgoSAT:以自我为中心的流媒体交互理解的综合基准

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

模型评测基准与评测资源

摘要

我们推出了 EgoSAT,这是流媒体环境中第一个以自我为中心的视频推理的综合基准,旨在评估现代视觉语言模型 (VLM) 的功能。该基准测试的目标是流式交互理解,其中视频帧按顺序到达,并且模型必须不断解释不断变化的视觉上下文。 EgoSAT 将之前几个不同的任务统一在一个流框架内。在这个表述中,对已完成事件的查询对应于回顾性推理,对正在进行的活动的查询需要在线理解,对未来行动的查询涉及前瞻性预期。这种统一的设置要求模型能够推理过去、现在和未来,同时在只有先前观察到的帧可用的约束下运行。 EgoSAT 包含 1,997 个独特视频,涵盖 165 小时的自我中心镜头和大约 4,800 个高质量问答对,经过精心设计,旨在探索不同时间背景下的推理。使用这个基准,我们评估了一组不同的开放权重和封闭权重 VLM,对其流交互理解能力进行系统评估。通过区分可回答性并对模型的置信度进行诊断,我们发现现有模型不仅难以应对前瞻性和回顾性建模,而且还表现出严重的错误校准:置信度通常无法跟踪固有的可回答性,从而导致危险的“自信错误”行为。项目页面:https://leiyj23.github.io/EgoSAT/