论文

UNIVERSE:用于自动驾驶的统一视频动作模型,具有灵活的掩模调制模态生成

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

模型架构Transformer

摘要

世界动作模型(WAM)通过使用未来视频预测作为场景动态和时间因果关系的密集监督,显示出改善自动驾驶动作泛化的强大潜力。然而,目前尚不清楚哪种架构能更好地将视频建模的优势转移到轨迹生成。现有的级联或双 DiT 设计将视频想象与动作预测分开,削弱了视频学习的世界动态向轨迹分支的转移:动作模型可能仍然过拟合数据集特定的驾驶先验,而视频模型仅间接规范化规划。我们提出 UNIVERSE,一个基于单个掩模调制扩散 Transformer 的统一视频动作模型。通过在共享生成参数内共同训练未来视频潜伏和自我轨迹标记,UNIVERSE 允许密集视频监督直接塑造轨迹去噪,从而实现更强的跨域动作泛化。为了确保因果有效性和高效部署,我们引入了模态解耦可见性掩模,它跨模态共享历史背景,同时阻止未来视频和轨迹标记之间的相互注意力。这可以防止未来目标泄漏,并通过在测试时消除未来视频去噪来实现仅轨迹推理,与联合视频动作轨迹展开相比实现 4.3倍的加速,同时保持可比的规划精度。同一模型还支持纯视频和联合视频动作轨迹生成。实验表明,UNIVERSE 在 NAVSIM 上实现了 91.0 PDMS(相对于 Two-DiT 变体为 89.6),并且在没有 微调 的情况下展示了向 nuScenes 和 Bench2Drive 的强大零样本传输,而消融则证实了单 DiT 统一、视频协同训练和基于掩模的模态解耦的重要性。