论文
NAVA-WAM:从纯观测视频为世界动作模型学习原生动作先验
Native Action-Prior Learning from Videos for World Action Models
摘要
世界动作模型整合未来视觉动力学与机器人动作预测,但其可扩展性受限于对动作标注机器人轨迹的需求。纯观测视频包含关于交互动力学的丰富证据,但既有方法通常要么用它们预训练视觉表示(后续仍须为控制适配),要么推断潜在动作再落地到机器人命令。我们提出NAVA-WAM,引入原生动作先验学习:直接从纯观测视频预训练动作策略,避免间接的表示到控制转移或单独的潜动作模型。训练分两阶段:先在纯观测视频上预训练——未来视频流匹配监督经转移结构化联合注意力传播以优化Action-DiT并学习动作相关先验;再用动作标注演示经联合视频-动作流匹配后训练Action-DiT用于机器人控制,非对称注意力把视觉分支与迭代动作去噪解耦并实现高效仅动作推理。大量实验显示NAVA-WAM在分布内与分布外设置下持续优于先前方法,展现强动作标签效率与有效真机泛化。结果确立原生动作先验学习为直接从纯观测视频预训练动作策略的有效方法,提供超越动作标注机器人数据的可扩展路径。