论文

EMPIRE:显式操作规划作为以自我为中心的手部运动预测的可学习中间表示

EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting

模型训练监督微调与指令调优

摘要

从以自我为中心的观察中预测灵巧的手部动作是智能交互系统的基础。现有的基于 VLM 的方法通常将观察结果直接映射到未来的运动,而忽略了控制手与物体交互的底层操纵过程。此外,端到端优化将操作学习与运动合成结合起来,导致运动生成梯度干扰预先学习的操作感知表示。为了克服这些限制,我们提出了 EMPIRE,这是一个两阶段框架,引入显式操作规划作为以自我为中心的手部运动预测的中间表示。第一阶段:学习计划。 EMPIRE 首先从多模态环境中学习显式操作计划,以捕获手部物体交互的进展。第二阶段:学习行动。运动生成器根据冻结的规划器表示来合成未来的双手运动,从而防止运动生成梯度影响操作规划。为了支持我们的方法,我们进一步构建了 EMPIRE-651K,这是一个双手运动预测数据集,包含 111 个任务的 650,910 个训练窗口,每个窗口都与一个明确的单手操作计划配对。在相同的训练和评估协议下,EMPIRE 实现了最先进的预测精度,MPJPE 为 84.53 毫米,手指相对误差为 38.97 毫米。我们在 https://github.com/wangwen-banban/EMPIRE 发布了代码和数据集。