论文

DVG-WM:解开的视频生成为机器人操作提供高效的具体世界模型

DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation

摘要

基于视频的具体世界模型通过预测未来状态为机器人操作提供了一个有吸引力的基础,但当前的方法仍然受到基本纠缠的限制:准确地建模动力学通常需要底层时序推理,而生成高分辨率帧需要根据高级语义进行扩展视觉合成。这种纠缠会导致迭代规划的推理速度缓慢或预测过于粗略而无法保留丰富的接触细节。为了解决这个困境,我们提出了解缠结视频生成世界模型(DVG-WM),这是一个有效的框架,可以将世界建模明确地分解为动态学习和视觉合成。以初始观察和语言指令为条件,我们的模型首先生成一系列合理的中间视觉状态来预览物理交互,并对其进行改进以获得高保真视频。此外,还提出了一种有效的级联机制,其中 DVG-WM 使用流匹配将动态直接映射到视频潜伏,并引入潜伏退化机制来重新生成接触丰富的细节。 LIBERO 和现实世界平台上的实验表明,视频质量得到了提高,加速高达 3.97 倍,验证了解开的视频生成可以成为机器人操作的有效体现世界模型。