论文

隐藏的事情:使用视觉语言模型识别规划关键的被遮挡智能体

What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models

模型训练合成数据

摘要

自动驾驶车辆必须安全地在复杂的环境中行驶,在这些环境中,规划关键的代理可能隐藏在视线之外。目前的方法通常以统一的保守主义对待所有遮挡,从而产生不必要的防御性驾驶,或者它们推断隐藏的空间而不估计对规划者的影响。这项工作通过使视觉语言模型(VLM)能够识别和推理对自我车辆轨迹最关键的特定隐藏代理,弥合了感知和规划之间的关键差距。我们引入了一种新颖的框架,该框架使用规划 KL 散度(PKL)(一种信息论度量)来根据遮挡智能体对自我车辆计划的影响来系统地识别和排名。利用这种规划感知排名,我们采用专家 VLM (GPT-5) 来生成丰富的结构化注释,以捕获此任务所需的视觉证据和推理。我们将此框架应用于 nuScenes 数据集,以创建一个专注于高影响力场景的新基准。我们对各种通用和领域适应的 VLM 进行了全面的实验,证明 微调 在我们的 PKL 引导数据上可以在所有模型中产生显着的性能改进。值得注意的是,我们的结果表明,较小的、经过微调的模型显着优于较大的零样本模型,并且我们的 PKL 引导数据选择策略比随机采样提高了约 30% 的性能。我们的工作提出了第一个系统方法来训练 VLM,使其专注于规划关键的遮挡,从而在自动驾驶中实现更语义化、更高效的风险评估。