论文

PEWAM可编程效果世界模型

Keep the Effect, Drop the Actor: Programmable Effect-to-Execution World-Action Models

摘要

机器人演示在同一些帧里记录了两件事:物体上发生了什么,以及某条特定的机械臂如何做到。我们以第一件事为条件。演示被编译为效果程序:被移动物体的三维关键点轨迹、标记每个物体被握住位置的两点、以及移除演示者后场景的终止构型。PEWAM是一个71.5M参数的世界动作模型,以四个独立流匹配时间生成效果、机器人执行、动作与终止状态,因此夹住程序并采样执行就把推理变成编程,从实时场景闭环重解。在留出的LIBERO-Goal任务上,一条演示的程序完成90回合中的40,而同一骨干以目标图像或语言为条件、以及已发表的演示条件方法至多完成19;在Meta-World三个留出类上超过已发表最优结果(不在五类均值上)。因为程序是一组坐标,人可以编辑它:放置跟随移位后的终止状态,抓握随旋转的接触点转动。同一程序在四条机械臂上零重训运行;受推扰后重解完成60回合中的23,而回放演示仅完成6。在Franka臂上经其他任务真机演示微调后,从单条人类视频编译的程序在40次试验中完成36次,对同一骨干以视频末帧为目标图像的22次。