论文
BARISTA:构图视觉理解的多任务自我中心基准
BARISTA: A Multi-Task Egocentric Benchmark for Compositional Visual Understanding
摘要
场景理解是一般物理智能的核心,而视频是捕获场景的状态和时间动态的主要方式。然而,理解物理过程仍然很困难,因为模型必须结合对象定位、手与对象交互、关系解析、时间推理和步骤级程序推理。现有的基准通常单独评估这些功能,限制了对模型在程序任务上失败原因的诊断。我们介绍 BARISTA,一个带有密集注释的以自我为中心的数据集和 185 个真实世界咖啡准备视频的基准,涵盖全自动、基于手柄和基于胶囊的工作流程。 BARISTA 提供经过验证的每帧场景图,将持久对象身份链接到蒙版、轨道、框、属性、类型关系、手对象交互、活动和流程步骤。从这些图中,我们推导出基于零样本语言的任务,涵盖短语基础、手物体交互识别、指代、活动识别、关系提取和时间视觉问答。实验揭示了不同任务系列之间的巨大差异,并且没有一致的主导模型系列,这将 BARISTA 定位为程序视频理解的具有挑战性的诊断基准。代码和数据集可在 https://huggingface.co/datasets/ramblr/BARISTA 获取。