论文

用于以自我为中心的自然语言查询定位的手轨迹融合

Hand Trajectory Fusion for Egocentric Natural Language Query Grounding

应用与实践视觉感知与空间理解

摘要

以自我为中心的自然语言查询 (NLQ) 基础要求模型在长的第一人称视频中本地化回答自由格式文本查询的时间间隔。现有方法将视频外观与查询融合在一起,但忽略了手部运动,尽管事实上大约 41% 的 Ego4D NLQ 查询是在手-对象操作或其直接结果的时刻得到回答的。我们提出了一种手部轨迹编码器,用于将一系列手部骨骼转换为高度语义的手部运动学特征,然后通过具有自适应门控的交叉注意融合策略将其与预训练的视频-文本特征进行对齐和组合。在 Ego4D NLQ v2 验证拆分中,最明显的增益出现在手-物体交互查询 (+2.54 R1@IoU=0.3) 和数量/状态查询 (+4.32 R1@IoU=0.3) 上,这表明手轨迹提供了超越外观的基础线索。