论文

通过单独的正向和逆向动力学预训练进行解缠机器人学习

Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

模型训练预训练

摘要

视觉-语言-动作(VLA)模型在构建通用机器人方面显示出了巨大的潜力,但仍然面临着 2D 图像预测和 3D 动作预测不一致的困境。此外,这种视觉-动作纠缠的训练方式限制了从大规模、无动作的网络视频数据中进行模型学习。为了解决这些问题,我们提出了 DeFI,这是一种新颖的框架,可以解耦视觉正向和反向动态预训练以利用各自的数据源,其中视频生成和动作预测是分离的。我们引入了通用正向动力学模型(GFDM),在不同的人类和机器人视频上进行预训练以进行未来预测,以及通用逆向动力学模型(GIDM),通过自我监督学习进行训练,以从未标记的视频转换中推断潜在动作。然后将这些模型集成到统一的架构中,以便对下游任务进行端到端的微调。就这样,GFDM和GIDM先是各自发光,然后合作共赢。 CALVIN ABC-D 和 SimplerEnv 上的大量实验展示了最先进的性能,其中 DeFi 的 CALVIN 平均任务长度为 4.51,SimplerEnv-Fractal 基准测试成功率为 51.2%,实际部署成功率为 81.3%,显着优于现有方法。