论文

使用 3D 感知 LLM 进行自我人类运动预测

Ego-Human Motion Prediction with 3D-Aware LLM

应用与实践视觉感知与空间理解

摘要

从第一人称的角度预测人类运动是 AR/VR、人机协作和嵌入式人工智能主动协助的基础。虽然最近的工作将语言作为一种语义先于减少第一人称的预测的不适定性质,但它们在很大程度上忽略了控制运动如何展开的 3D 空间和语义上下文,并将姿势和语言预测视为单独的推理流。我们介绍 Ego3DLM,它建立在两个核心原则之上:准确的运动预测需要对 3D 环境进行明确的空间和语义理解,并且必须在一次传递中整体预测姿势和语言,因为运动本质上与所执行动作的语义解释相关。给定三点跟踪、3D 场景特征和第一人称的视频,Ego3DLM 在单个自回归过程中同时解码过去的姿势、未来的姿势、过去的叙述和未来的叙述,将预测的姿势和描述相互结合以强制跨模式和时间一致性。我们采用三阶段训练方案:(1)空间语义场景感知预训练; (2) 单次对所有四个输出进行整体指令调整; (3) 基于 GRPO 的强化微调,具有模内和模间奖励,可直接优化姿势语言保真度。 Nymeria 基准测试表明,Ego3DLM 在未来运动预测、过去运动跟踪和运动描述方面实现了最先进的性能,表明 3D 场景基础和整体跨模态预测可产生物理上合理且语义上一致的运动预测。该项目页面位于 https://jaewoo97.github.io/Ego3DLM/。