论文
从大规模人类机器人操作演示中学习人类意图先验
Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation
摘要
人类视频包含丰富的操作先验,但将它们用于机器人学习仍然很困难,因为原始观察涉及场景理解、人类运动和具体实施例的动作。我们介绍了 MoT-HRA,这是一种分层视觉-语言-动作框架,可以从大规模人类演示中学习人类意图先验。我们首先策划 HA-2.2M,这是一个 2.2M 集的动作语言数据集,通过以手为中心的过滤、空间重建、时间分割和语言对齐从异构人类视频中重建。在此数据集之上,MoT-HRA 将操作分解为三个耦合专家:视觉语言专家预测与具体实施无关的 3D 轨迹,意图专家将 MANO 式手部运动建模为潜在的人类运动先验,而精细专家将意图感知表示映射到机器人动作块。共享注意力主干和只读键值传输允许下游控制使用人类先验,同时限制对上游表示的干扰。手部动作生成、模拟操纵和现实世界机器人任务的实验表明,MoT-HRA 提高了分布偏移下的运动合理性和鲁棒控制。