论文

LaST-HD:从可扩展的人类数据中学习潜在的物理推理以进行机器人操作

LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation

模型训练监督微调与指令调优

摘要

人手演示为机器人学习提供了直接且可扩展的物理交互数据源。虽然手动重定向对于在不同形态之间建立运动学动作对应是必不可少的,但稳健的传输需要超越几何结构来解决人类和机器人操作之间物理动力学的基本对齐问题。为了解决这个问题,我们引入了 LaST-HD,这是一种新颖的人机动作学习范式,它通过在共享的潜在推理空间中对齐人手和机器人演示来扩展先推理后行动的 VLA。 LaST-HD 不是模仿人类运动学,而是在不成对的人手和机器人轨迹上训练辅助动作条件世界模型,以合成统一的潜在目标。在这个共享的前向动力学空间中对齐跨实施例表示后,这些目标监督 LaST-HD 的潜在推理过程,使其能够内化共享的物理动力学并驱动高效的人手动作学习。此外,我们还开发了实验室外 (OOL) 手套,这是一种专为 LaST-HD 定制的低成本动作捕捉手套,用于人手数据收集。捕获的人体数据提供了精确的关键点,并作为对抓手和灵巧手的通用动作监督。借助对齐的潜在空间和高保真人手数据,我们开发了一种渐进式的人机混合训练方案,包括人机混合协同训练和人手在线校正 后训练。通过混合协同训练,LaST-HD 仅使用人手演示即可提高对新物体、场景和位置的泛化能力。通过在线校正,LaST-HD 进一步适应新环境,仅使用 20 分钟的 OOL 手套数据即可实现超过 90% 的准确率。