论文

Dream.exe:视频生成模型可以梦想可执行的机器人操作吗?

Dream.exe: Can Video Generation Models Dream Executable Robot Manipulation?

模型评测基准与评测资源

摘要

视频生成模型在合成视觉上引人注目的内容方面取得了令人印象深刻的进步,但其输出仍然局限于虚拟领域。一个自然的问题随之而来:当这些模型生成的视频离开屏幕并进入现实时,这些模型如何反映物理世界?我们提出机器人操纵作为解决这个问题的一个具体的、可测量的窗口:如果一个模型真正具有内化的物理定律,那么它所描述的运动应该转化为可执行的机器人行为。我们引入了 Dream$.$exe,这是一个评估框架,可通过视频到执行管道来实施此标准。给定场景图像和任务描述,Dream$.$exe 合成操作视频,将生成的运动转换为机器人轨迹,并在物理模拟器中执行它们,产生纯粹视觉指标无法提供的基础信号。使用此流程,我们评估了涵盖前沿闭源生成器、开源生成器和机器人特定模型的 8 个模型。我们的基准测试涵盖了三个物理复杂程度的 101 个手动策划的操作任务,从视觉质量、轨迹保真度和执行成功度进行衡量。令人鼓舞的是,一些模型取得了可衡量的执行成功,这表明从互联网规模的数据中学习的生成先验已经编码了有意义的物理知识。然而,事实证明,视觉质量对可执行性的预测效果很差,暴露了标准视觉评估无法捕获的模型功能维度。 Dream$.$exe 将在 https://github.com/showlab/Dream.exe 开源。