论文

EgoLAP:以语言动作推理迁移第一视角人体数据

EgoLAP: Learning from Egocentric Human Data through Language-Action Reasoning

模型训练预训练

摘要

以自我为中心的人类数据为扩展机器人学习提供了一条途径,超越了昂贵的机器人演示,但体现差距使得原始人类轨迹成为一个糟糕的控制监督目标。我们的主要见解是,尽管低级动作是特定于实施例的,但它们的潜在运动意图可以捕获在人类和机器人之间传输的任务相关结构。我们介绍了 EgoLAP,这是一个 VLA pre-训练框架,它通过基于共享语言的动作思想链共同学习人类和机器人的轨迹。 EgoLAP 将运动意图表达为结构化的、时间抽象的语言动作,并将它们与基于场景几何、物理和对象可供性的运动级推理配对。在广泛的现实世界和模拟实验中,EgoLAP 比替代动作表示更有效地将人类经验转移到机器人控制中,并达到了 80.1% 的平均现实世界任务进度,比替代动作表示提高了 2.3 倍的性能增益。运动级推理还优于结合了子任务、对象框和视觉跟踪推理的复合推理格式。

EgoLAP:以语言动作推理迁移第一视角人体数据:论文原图
图 8:详细的 EgoLAP 架构。共享的 SigLIP 编码器将每个摄像机视图映射到视觉 token。 2B VLM 分支预测运动级推理和语言动作; 300M 动作专家将嘈杂的 动作块 映射到其流速。这两个分支持有独立的参数,但在每个转换器层加入相同的屏蔽注意力操作。 token 的动作专注于观察、指令和离散化状态,从不关注文本目标,而梯度通过 VLM 键和值进行停止。