论文

UNITAS:在共享三维空间统一机器人动作与世界变化

UNITAS: A 3D-Native World Action Model for Embodied Manipulation

模型架构应用与实践新型架构机器人

摘要

世界动作模型(WAM)旨在回答相互关联的物理问题:给定任务指令,机器人应执行什么运动,这种运动又会如何改变周围世界?多数现有WAM基于预训练视频生成器,以图像或视觉潜表示描绘世界变化。但机器人交互发生在具有真实尺度的三维空间,图像只是依赖视角的投影,像素距离并不直接表达物理距离。我们提出UNITAS。据我们所知,这是首个原生三维世界动作模型,在每次交互中将观测、动作和场景动力学统一于共享的、具有真实尺度的三维坐标系,并在人手及不同机器人形态之间使用通用表示。动作流将人手和机器人夹爪表示为三维点轨迹,场景流则描述以这些轨迹为条件的场景点位移。与世界坐标对齐的三维位置嵌入为视觉token提供空间定位,无论输入是否包含深度;基于物理时间的轨迹分词器把每条点轨迹编码为锚定在当前三维位置的一个token。该接口同时支持直接动作执行和动作条件场景预测。UNITAS拥有17亿参数,在所比较方法中获得RoboTwin上最好的动作条件场景预测结果,相比PointWorld位移误差最多降低49%;操作成功率也达到先进水平,包括LIBERO上的99.8%和真实任务平均85%。代码:https://github.com/DexForce/UNITAS.