论文
OmniDrive:LLM 精心设计的多智能体世界模型,具有统一潜在协同压缩,用于多视图驾驶视频生成
OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation
摘要
自动驾驶的生成世界模型面临两个未解决的紧张局势:异构控制注入,其中自由形式语言、高清地图、轨迹和相机姿势驻留在不兼容的表示空间中,以及事后跨视图融合,其中每个相机的潜在特征无法编码全局 3D 几何。我们将两者追溯到一个根本原因:在潜在的 词元级 处缺乏共享的符号国际语对齐语言、几何图形和像素。我们提出了 DRIVE-CHOREO,这是一种由 LLM 精心设计的多智能体世界模型,它将可控多视图视频生成重新设计为潜在的编排。三个 Qwen2.5-VL 代理(一个将用户意图解析为结构化 WorldScript 的总监,一个将其转化为空间锚定布局标记的制图师,以及一个反馈跨视图批评作为辅助监督的审计员)共同创作一个位置感知标记序列。该序列通过视图时间排列与多视图视频共同压缩,该排列在 3-D VAE 的卷积感受野内强制实施摄像机间几何结构。在 nuScenes 上,DRIVE-CHOREO 设定了新的最先进的多视图一致性和 BEV mAP (21.6) 以及具有竞争力的 FVD (45.7);纯粹根据我们的合成数据训练的检测器在真实验证分割上获得+2.4 NDS,验证下游效用。