论文

SWEET:稀疏世界建模与图像编辑用于具体任务执行

SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution

智能体系统Agent 规划

摘要

视觉预测已成为一种有前途的体现控制范例,其中生成未来的观察结果,然后转化为行动。然而,密集视频生成的计算成本很高,并且对于许多操作任务来说通常是不必要的,这些任务的进展可以通过少量与任务相关的视觉状态来概括。在这项工作中,我们研究图像编辑模型是否可以通过预测任务级未来状态而无需密集视频采样轨迹来充当机器人操作的稀疏视觉世界模型。我们首先在相同的机器人数据设置下对视频生成模型 Wan2.2 和图像编辑模型 FLUX-Kontext 进行受控比较,发现图像编辑产生更可靠的任务级关键帧,具有更好的视觉保真度和显着降低的推理成本。受这一观察的启发,我们提出了 SWEET,这是一种一次性稀疏视觉规划框架,它通过连续的图像编辑,以语言指令和可选的基于箭头的空间指导为条件,逐步生成一系列与任务相关的操作关键帧。然后,目标条件扩散动作预测器将相邻的想象关键帧转换为可执行的动作块。为了减少真实和编辑的视觉子目标之间的不匹配,我们进一步引入了带有过滤编辑目标的混合训练策略。 DROID 和 RoboMimic 上的实验表明,SWEET 改进了可见和未见场景的关键帧预测,并实现了从顺序关键帧规划到可执行机器人动作的完整流程,这表明图像编辑是体现视觉预测的一个有前途且尚未充分探索的方向。