论文

CausalDrive:自动驾驶的实时因果世界模型

CausalDrive: Real-time Causal World Models for Autonomous Driving

摘要

世界模型已成为扩展自动驾驶(AD)数据的有前途的范例,但现有的视频生成模型不足以作为交互式模拟器。布局条件渲染器依赖于所有后台代理的“oracle”未来轨迹,使它们严格非反应性。相反,纯粹的动作条件预测器缺乏对复杂交互的语义控制,并且受到令人望而却步的扩散延迟的影响,阻碍了闭环策略学习。为了弥补这一差距,我们推出了 CausalDrive,一个可控的实时基础驱动世界渲染器。 CausalDrive 仅对初始前视图框架、自我车辆的轨迹和宏观文本提示进行操作。通过排除未来的 NPC 布局,我们迫使模型从本质上预测因果交互,从而实现对驾驶社会学的文本驱动控制,允许用户动态地协调对相同自我行为的不同反事实反应。为了克服效率瓶颈并解决自回归生成中的协变量偏移,我们提出了一种新颖的上下文强制 DMD 架构。它将连续流匹配与自校正 蒸馏 物镜相结合,实现 12 FPS 的交互速度。这一突破将被动视频生成器转变为可玩的神经模拟器。我们展示了其在三个下游应用程序中的多功能性:(1) 显着减轻碰撞伪影的生成闭环评估,(2) 由 Video2Reward 模块驱动的大规模强化学习 (RL) 后训练,以及 (3) 实时人在环仿真。大量实验验证了在 CausalDrive 反应场景中训练的策略在现实世界中表现出卓越的交互能力。