论文
Artemis:以共享三维状态与渐进记忆生成多 Agent 驾驶世界
Artemis: Geometry-Grounded Multi-Agent Driving World Models with Shared 3D State and Progressive Memory Update
摘要
最近的视频世界模型见证了从单智能体到多智能体参与的范式转变,这可以揭示现实世界中更复杂的动态和跨智能体交互。然而,现有的方法通常采用通过交叉注意力的隐式智能体间通信,缺乏显式的几何约束和统一的 3D 状态,从而导致多视图一致性较差,并且难以恢复视线外的智能体。此外,它们中的大多数假设静态背景,无法代表不受控制的背景动态。为了解决这些问题,我们提出了 Artemis:一种基于几何的多智能体世界模型,具有显式的记忆共享。根据多个智能体观测值重建显式 3D 世界地图,以在智能体上实施统一的 3D 状态,从而提供高度的跨视图一致性。具体来说,开发了一个动作引导的几何注入模块来同时渲染分解的前景-背景控制图,然后通过设计的 GeoAdapter 块将其注入到扩散变换器中。与之前假设纯静态背景的方法相比,我们的 GeoAdapter 还可以区分不受控制的非智能体动态,这些动态以它们自己的多帧历史位置为条件,以提供一致的运动线索。从渐进式视频 执行轨迹 中选择的关键帧用于逐步更新重建的 3D 世界地图。为了有效捕获复杂的动态模式,我们策划了一个从 CARLA 模拟器采样的新颖数据集,称为 MA-CARLA。大量的实验证明了我们提出的方法在生成视频的视觉保真度和跨视图一致性方面的优越性。此外,我们的 Artemis 可以支持同步多模态 执行轨迹,同时进行 2D 视频和 3D 点图维护,扩展到超出两个智能体和多摄像头设置的场景。
