论文

EVO-WAM:通过视频动作验证不断发展的世界动作模型

EVO-WAM: Evolving World Action Models through Video-Action Verification

模型训练合成数据

摘要

在不收集额外专家演示的情况下改进机器人针对新任务的策略仍然是机器人学习的核心挑战。世界动作模型(WAM)使用广泛的视频先验来共同预测未来的视频和动作,为适应新任务提供潜在的监督来源。然而,生成的视频可能无法描绘任务完成情况,甚至视觉上成功的视频也可能与导致执行失败的不一致动作配对。我们提出了 EVO-WAM,这是一个框架,通过学习 WAM 自己生成的视频动作轨迹来适应看不见的任务,而无需在外部环境中执行候选动作。首先,我们通过状态预测和锚定多帧上下文来增强 WAM 训练,以实现完整的自回归部署,而无需外部执行反馈。其次,我们通过使用视觉语言模型选择完成任务的前缀并使用逆动态模型验证其视频动作一致性来确定可靠的训练体验。第三,我们在经过验证的前缀上迭代训练 WAM,并使用更新后的模型生成新的rollout。在七个未见过的 RoboTwin 2.0 任务中,EVO-WAM 将 Cosmos3 的平均成功率从 26.9% 提高到 68.0%,将 DreamZero 从 28.5% 提高到 46.4%,分别达到初始成功率的约 2.5 美元和 1.6 美元。在现实世界中三个看不见的长视野复合任务上,它将 Cosmos3 的平均成功率从 20.0% 提高到 76.7%,提高了 56.7 个百分点。项目页面:https://evo-wam.github.io/.