论文

Dream4ACT:用于多具身平台视频动作建模的共享视觉动作界面

Dream4ACT: A Shared Visual Action Interface for Multi-Embodiment Video-Action Modeling

摘要

视频生成模型(VGM)为具身观察动作建模提供了强大的时空先验。然而,关节空间动作向量缺乏明确的图像空间结构,并且在不同具身平台的维度和语义上有所不同,使得直接利用 VGM 丰富的时空先验变得具有挑战性。末端执行器可视化提供了一种替代方案,但没有指定机器人执行所需的完整铰接配置。我们提出了 Dream4ACT,这是一个为跨具身平台的联合视频动作建模而构建的世界模型。为了统一跨具身平台的动作表示,我们引入了一个共享的视觉动作界面,称为动作视图,它使用基于 URDF 的正向运动学从四个规定的虚拟相机渲染目标关节配置。这种共享的视觉表示保留了特定于具身平台的铰接几何形状,同时允许观察和动作序列共享视频自动编码器和扩散Transformer。通过屏蔽流匹配,我们的模型支持正向动力学、逆向动力学和联合观察——通过改变未来序列被损坏的方式在单个联合训练模型中生成动作。为了从预测的动作视图恢复可执行的动作序列,我们提出了一种免训练、URDF约束的多视图恢复机制,无需学习的特定于具身平台的解码器。 Dream4ACT在RoboTwin~2.0上的平均成功率为88.98%,在TriWorldBench上的总分为65.66,通过视觉动作界面支持有效的闭环操纵和竞争性动作条件多视图预测。