论文
SafeGen:基于 VLM 的自动驾驶安全关键场景的目标条件视频扩散
SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving
摘要
VLM 越来越多地部署在 AD 系统中,迫切需要在罕见但安全关键的场景下进行严格的安全评估。其中,与弱势道路使用者的互动是现实世界失败的主要根源。然而,现有的安全关键场景生成方法主要依赖于基于模拟器的管道,这些管道存在巨大的模拟与真实差距,并且往往无法捕捉现实、多样化和不可预见的人车交互动态。我们提出了 SafeGen,这是一种目标条件扩散框架,用于在 VLMAD 中生成安全关键场景。我们的主要见解是将场景生成制定为目标条件扩散过程,其中预定义的灾难性最终状态作为强大的监督信号,指导生成时间相干的视频轨迹,自然地演变成安全关键的结果。在此基础上,我们引入了基于情境的最终状态推理,它利用 VLM 来分析良性驾驶情境并推断人车交互中的潜在漏洞,从而生成引发高风险场景的结构化最终状态规范。以这些目标为条件,我们进一步提出最终状态条件视频进化,它将语义威胁转化为物理上合理的视觉动态。具体来说,我们通过深度感知的几何投影在场景中实例化高风险代理,然后进行边界条件扩散以生成具有一致运动模式和时间连贯性的中间帧。跨越 3 个 VLMAD 的广泛实验表明,与 SoTA 基线相比,SafeGen 将法官总体得分(使用 VLM 法官评估 VLMAD 理解和决策的指标)平均提高了 24.25%。此外,微调 a VLMAD 将现实驾驶场景中的性能平均提高了 15.9%。