论文

WorldDiT:用于世界和动作建模的统一扩散架构

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

模型架构新型架构

摘要

最近的许多机器人政策通过使用大型预训练视觉语言模型(VLM)作为动作支柱来追求更强的控制。我们引入了 WorldDiT,这是一种统一扩散 Transformer 架构,它将动作生成与视觉世界建模相结合,无需大型预训练 VLM 动作主干即可实现强大的性能。在训练期间,单个扩散 Transformer 生成连续动作块,并根据未来相机帧预测归一化 RGB 补丁目标。在四个 LIBERO 模拟套件中,WorldDiT 位于报告的总模型参数的帕累托前沿,以及报告所有四个套件的方法的平均成功率。这些结果为未来的规模化研究提供了强大的数十亿参数基线。