论文

MachEmbodied-U0:具身智能的统一理解和生成模型

MachEmbodied-U0: Unified Understanding and Generation Model for Embodied Intelligence

摘要

通用机器人控制需要模型来理解任务意图、确定交互位置、捕捉场景如何演变并生成精确的动作。视觉-语言-动作模型提供了强大的语义先验,但通常不会显式地对场景动态进行建模,而世界动作模型将视觉预测与控制结合起来,而不必暴露细粒度操作所需的与任务相关的语义和空间结构。我们提出了 MachEmbodied-U0 (ME-U0),这是一个统一的体现基础模型,通过 Mixture-of-Transformers 架构连接理解和生成专家。子任务预测和可供性基础通过流程匹配指导联合视觉动力学和动作生成。视觉动力学涵盖未来的 RGB、深度、表面法线和光流,为外观、几何和运动提供补充监督。多速率旋转位置编码 (MRPE) 将视觉动态与细粒度控制结合起来。我们根据机器人数据集和自我中心数据集对 ME-U0 进行了约 4,200 小时的精心策划演示的预训练。仅使用每个下游基准测试中原生的监督,ME-U0 在 RoboDojo 模拟基准测试中获得了 17.66 的平均分数,在 LIBERO 和 LIBERO-Plus 上的平均成功率分别为 99.0% 和 82.5%。我们还在现实世界的机器人操作任务中验证了 ME-U0,证明了其超越模拟的有效性。在没有相应的下游监督的情况下,ME-U0 进一步展示了零样本子任务预测、可供性基础以及模拟和现实世界观察的视觉动态。总体而言,ME-U0 将具有竞争力的下游控制性能与跨模拟和现实世界的可转移任务基础和视觉动态功能相结合。