论文
ImageWAM:世界动作模型真的需要视频生成,还是只需要图像编辑?
ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?
摘要
世界动作模型 (WAM) 通常依靠视频生成来连接视觉世界建模和机器人控制。然而,基于视频的 WAM 面临三个耦合限制:密集的多帧未来词元使推理成本高昂,完整的视频预测将容量花费在与动作无关的时间和外观细节上,以及长期的未来想象可能会引入误导动作预测的错误。这些问题提出了一个简单的问题:世界行动模型真的需要视频生成吗?我们提出了 ImageWAM,这是一个简单的 WAM 框架,它将预训练的图像编辑模型重新用于机器人动作预测。与视频生成相比,图像编辑提供了更好的匹配先验:它只需要对目标帧转换进行建模,专注于与动作相关的当前到目标的视觉差异,并通过编辑预训练将任务指令基于局部视觉变化。实际上,ImageWAM 在推理时不会解码目标帧;相反,它在图像编辑去噪生成的 KV 缓存上为流匹配动作专家提供条件,将它们用作紧凑的世界动作上下文。 ImageWAM 的性能优于标准 VLA 基线,并且可以与竞争性 WAM 相匹配,无需在不同的模拟器和现实世界实验中进行额外的策略预训练。与基于视频的 WAM 相比,它还将 FLOP 降低至 1/6,延迟降低至 1/4。注意力分析进一步表明,编辑缓存专注于与任务相关的变化区域,支持图像编辑作为基于视频的世界动作建模的有效替代方案。