论文
CLAP:端到端自动驾驶的对比潜在空间提示优化
CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving
摘要
由视觉-语言-动作 (VLA) 模型支持的端到端自动驾驶系统在常见驾驶场景中实现了强大的性能,但在罕见但安全关键的长尾情况(例如活跃的施工区域和复杂的屈服几何形状)中仍然很脆弱。在本文中,我们提出了一种方法,可以解决数据缩放和 模型训练 之外的长尾挑战性场景。我们引入了 CLAP(对比潜在空间提示优化),这是一种位置感知适应框架,它通过每个路障的软提示来增强冻结的 VLA 驾驶模型,从众包数据中进行优化,并通过车辆到一切 (V2X) 通信按需检索。我们的方法基于对 VLA 潜在空间的两个观察:(i)在 VLA 的隐藏状态层,来自同一路障簇的场景紧密地占据潜在空间的紧凑区域; (ii) 在单个路障内,长尾帧和正常帧在潜在表示中严重混合,使得很难在不干扰另一个的情况下改进一个帧。 CLAP 通过两阶段管道解决此问题:监督对比学习以发现路障特定的硬场景方向,然后进行方向正则化提示优化,选择性地改进具有挑战性的帧,同时保持正常帧性能。在具有各种最先进的 VLA 主干的 NAVSIM 基准上,CLAP 将具有挑战性的场景规划错误减少了 24%,并且在正常帧上没有回归,从而显着提高了规划性能。