论文
Metis:适用于自动驾驶和城市导航的通用且高效的世界行动模型
Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation
摘要
世界行动模型(WAM)在自动驾驶和城市导航方面展现出了巨大的前景。现有方法建立在视觉-语言-动作模型或视频生成模型的基础上,受到关键限制:(1) 由于测试时的未来观察预测而导致推理延迟较高,(2) 视频和动作建模紧密耦合,导致表征不匹配和泛化能力下降。为了解决这两个问题,我们提出了 Metis,一个端到端的 WAM 框架,可以解耦视频生成和动作预测。具体来说,Metis 采用 Mixture-of-Transformer 架构,配备专门的专家进行视频生成和动作预测,保留每个任务的固有分布属性。为了提高效率,我们引入了一种非对称注意掩模,可以对两位专家进行联合训练,同时允许动作模型在推理过程中绕过显式视频生成。这种设计确保了训练推理的一致性,并在不影响规划性能的情况下显着降低了计算成本。大量实验证明了 NAVSIM navhard 和 navtest 基准以及 CityWalker 导航基准的最先进性能,验证了不同任务的通用性和效率。真实的机器人部署进一步证实了我们方法的实际可行性。