论文

EA-WM:具有结构化运动学到视觉动作场的事件感知生成世界模型

EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields

模型架构新型架构

摘要

预训练的视频扩散模型提供了强大的时空生成先验,使它们成为机器人世界模型的天然基础。虽然最近的世界动作模型联合优化了未来的视频和动作,但它们主要将视频生成视为政策学习的辅助表示。因此,他们没有充分探索逆问题:利用动作信号来指导视频合成,从而常常无法在生成的展示中保留精确的机器人空间几何形状和细粒度的机器人与物体交互动态。为了弥补这一差距,我们提出了 EA-WM,这是一种事件感知生成世界模型,可以有效地闭合运动控制和视觉感知之间的循环。 EA-WM 不是将关节或末端执行器动作作为抽象的低维标记注入,而是将动作和运动学状态作为结构化运动学到视觉动作场直接投影到目标摄像机视图中。为了充分利用这种基于几何的表示,我们引入了事件感知的双向融合块,它可以调节跨分支注意力,捕获对象状态变化和交互动态。根据综合 WorldArena 基准进行评估,EA-WM 实现了最先进的性能,大幅优于现有基准。