论文

G3Ego:用于理解自我中心行为的凝视引导图

G3Ego: Gaze-Guided Graphs for Egocentric Action Understanding

应用与实践通用理解与问答

摘要

通常使用在广泛的外中心数据集上预训练的大型视频模型来解决以自我为中心的动作理解。然而,许多第一人称动作依赖于仅涉及少数相关实体的少量手部物体交互。我们提出了 G3Ego,一个基于图的框架,用于理解以自我为中心的动作,它使用凝视作为结构线索来识别场景中与动作相关的实体。 G3Ego 根据稀疏采样的帧,根据视觉语言描述、已定位物体和手势构建动作场景图,然后使用相机佩戴者的视线修剪不相关的实体。生成的图嵌入会暂时聚合以进行动作识别和预测。与之前主要使用凝视作为辅助模态或注意信号的工作不同,G3Ego 将凝视直接纳入图形构建中,生成专注于动作相关交互的高效且可解释的表示。 EGTEA Gaze+ 和 MECCANO 上的实验表明,与基于视频的方法相比,G3Ego 实现了有竞争力的性能,并在类不平衡评估下持续改进 Macro-F1,同时避免了对计算成本昂贵的视频预训练的依赖。这些结果证明了凝视引导图形表示对于自我中心行为理解的有效性。