论文

EgoEverything:人类行为的基准激发了 AR 环境中长上下文以自我为中心的视频理解

EgoEverything: A Benchmark for Human Behavior Inspired Long Context Egocentric Video Understanding in AR Environment

模型评测基准与评测资源

摘要

长上下文自我中心视频理解最近引起了广泛的研究关注,其中增强现实(AR)被强调为其最重要的应用领域之一。然而,由于需要对扩展的时间背景和多样化的非结构化活动进行推理,这项任务仍然极具挑战性。尽管存在多个基准,但大多数以自我为中心的数据集依赖于人类佩戴的相机,并且主要关注视觉内容,在形成视频相关查询时对潜在用户行为的考虑有限。 EgoEverything 是一个基准,在生成问题时,通过利用从注视数据中提取的人类注意力信号来明确考虑人类行为。它包含 5,000 多个多项选择题答案,涵盖超过 100 小时的视频。通过在问题生成过程中整合人类注意力信号,它可以更忠实地捕捉人类的自然行为,并为 AR 中的长上下文自我中心视频理解提供现实的评估设置。