论文
从驾驶视频到可模拟场景
From Driving Videos to Simulatable Scenarios
摘要
自动驾驶汽车 (AV) 面临从日常交通到罕见事件的各种驾驶场景。为了评估安全性,以可控、可重复和可扩展的方式重现这些场景至关重要,其中仿真发挥着关键作用。本文介绍了 D-V2S,这是一种新颖的框架,可以从驾驶视频自动生成可模拟的驾驶场景。 D-V2S 分两个阶段运行:驾驶记录分析器 (DRA) 使用视觉语言模型 (VLM) 和我们设计的提示,根据输入视频生成自然语言描述,捕获道路布局和动态交通交互;随后,场景生成器 (SG) 使用 大语言模型 (LLM) 和我们的条件上下文将这些描述转换为可执行场景。通过模拟,我们表明 D-V2S 生成的场景中存在视频 90% 的相关语义元素。我们还提供定性结果,证明 D-V2S 将现实世界的驾驶视频转换为可模拟场景的能力。此外,我们还提供 D-V2S 模块的语义和人类驱动的烧蚀分析。特别是,我们展示了 VLM 选择对 DRA 的重要性,以及我们的 SG 如何实现比其他最先进方法高出 75% 的偏好率。