论文

EggHand:用于自我中心手势预测的多模态基础模型

EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting

应用与实践视觉感知与空间理解

摘要

从以自我为中心的视频中预测未来的 3D 手势序列对于理解人类意图和实现 AR/VR 辅助和人机交互等具体应用至关重要。然而,这项任务仍然是一个极具挑战性的问题,因为以自我为中心的手部运动是由复杂的人类意图驱动的,表现出高度灵巧的关节,并且在自我运动引起的剧烈视点变化下观察到。在这项工作中,我们介绍了 EggHand,一个基于基础模型的框架,用于以自我为中心的手势预测,它将多模态语义推理与动态运动建模相结合。我们的方法将视觉语言动作(VLA)模型的动作解码器与自我中心的视频文本编码器结合起来,该模型捕获手部运动的结构化时间动态,该编码器提供从大规模第一人称视频中学习到的视点感知上下文信息。这些组件共同克服了通用视觉编码器在自我运动下的脆弱性,并能够对运动、上下文和高级意图进行联合推理,而无需依赖身体姿势或外部跟踪。 EgoExo4D 数据集上的实验表明,EggHand 在预测准确性方面树立了新的技术水平,在严重的自我运动下保持鲁棒性,并进一步通过基于语言的任务提示实现可控预测。项目页面:https://jyoun9.github.io/EggHand