论文

JoyAI-RA 0.5:通过双动作对齐扩展机器人操作学习

JoyAI-RA 0.5: Scaling Robot Manipulation Learning via Dual Action Alignment

模型训练预训练

摘要

机器人数据稀缺,因此通才政策需要从异构来源学习,包括人类以自我为中心的视频、模拟和真实机器人,它们在监督和体现方面存在差异,动作标签缺失或相互不兼容。人类以自我为中心的数据规模最大,但距离机器人数据最远,而天真的池化会导致负迁移而不是知识共享。我们提出了 JoyAI-RA 0.5,这是一个通用的视觉-语言-世界-动作(VLWA)框架,它将物理世界动态先验与视觉语义结合起来,并通过双动作对齐来扩展跨这些数据的操纵学习。隐式动作对齐从视觉转换中推断出潜在动作,使无动作的人类、模拟和机器人数据能够指导学习物理动力学的潜在动作条件世界模型。显式对齐通过规范的动作表示和相机帧块相关的末端执行器动作,在统一的物理动作空间中建立可靠的人类和机器人轨迹。然后,内外循环强化阶段将有效的任务适应与基础策略改进结合起来。在现实世界的 AgiBot 基准测试中,JoyAI-RA 在已见的任务和未见的变化上都表现出色。随着人类以自我为中心的预训练数据量的增加,任务得分持续提高,并且在我们最大的规模上没有表现出稳定的迹象。这表明丰富但弱标记的人类经验可以转换为可转移的训练信号,使人类视频不仅是弱辅助源,而且是可以扩展操纵能力的主轴。项目页面可以在 https://joyai-ra-05.github.io/ 找到。