论文
SUV:未来场景理解作为端到端驾驶的视频生成
SUV: Future Scene Understanding as Video Generation for End-to-End Driving
摘要
端到端驾驶需要对未来场景有连贯的理解,但现有方法使用特定于任务的头和输出格式对这些场景进行建模,可扩展性有限。视频生成可以提供共享预测器吗?我们推出了 SUV,这是一个统一的端到端驾驶框架,它使用预训练的视频基础模型将未来的场景理解转化为视频生成。 SUV 通过共享视频专家将未来的外观、语义、相对深度和实例级动态建模为视频流,无需特定于流的视觉预测头。通过联合视频动作注意力,动作专家关注所有未来流的潜在表示并生成自我轨迹。实验表明,SUV 直接预测所有四个未来流,而受控消融表明,结构化未来监督和直接未来流访问会产生更高的轨迹规划得分。由于只有一个前置摄像头且没有候选轨迹选择,SUV 在 NAVSIM-v2 分割上的表现优于一系列最新的最先进方法,在 navtest 上达到 91.0 EPDMS,在 navhard 上达到 36.9。在长尾WOD-E2E基准上,SUV实现了具有竞争力的RFS 7.94。