论文
FlowWAM:光流作为世界行动模型的统一行动表示
FlowWAM: Optical Flow as a Unified Action Representation for World Action Models
摘要
世界动作模型 (WAM) 能够利用预先训练的视频生成器进行世界建模和动作预测。然而,直接利用此类视频生成器进行控制提出了一个新的挑战:如何以合适的形式表示动作,与预先训练的视频生成器保持一致,同时携带足够的运动线索以进行精确控制。现有的数字动作无法满足前者,并且先前的视觉动作表示忽略了跨帧的时间运动结构。我们通过 FlowWAM 解决了这个问题,这是一种双流扩散框架,采用光流作为统一的视频原生动作表示。 Flow 视频与 RGB 视频共享相同的格式,并编码丰富的每像素位移。通过在共享的预训练视频生成器中对它们进行联合建模,FlowWAM 可以自然地实现两种模式的 WAM。在策略模式下,FlowWAM 生成用于动作预测的流,而在世界模型模式下,它使用目标流序列来指导未来的视频生成。此外,由于可以轻松地从没有动作标签的原始视频中提取流,因此 FlowWAM 可以利用大规模动作未标记视频数据集进行预训练。我们凭经验发现,基于流程的动作表示在两种模式下都能带来收益。在 RoboTwin 操作中,FlowWAM 在 Clean 设置下将成功率提高到 92.94%,在 Random 设置下将成功率提高到 92.14%,优于 VLA 和 WAM 基线。在 WorldArena 世界建模中,它实现了最佳整体 EWMScore (63.71),轨迹精度相对提高了 18.4%。更多结果可以在我们的项目网站上找到:https://flow-wam.github.io。