论文
在操作设计领域内操作:使用视觉语言模型的零样本感知
Operating Within the Operational Design Domain: Zero-Shot Perception with Vision-Language Models
摘要
在过去的几年里,自主系统的研究已经成熟到了如此程度,以至于该领域越来越有能力将研究转化为跨越明确领域的实际的、利益相关者驱动的用例。然而,为了大规模实际采用自主系统,遵守安全法规至关重要。许多法规都受到操作设计领域 (ODD) 的影响,该领域定义了自主代理可以运行的特定条件。这对于自动驾驶系统 (ADS) 尤其重要,因为 ODD 元素的可靠感知对于安全实施和审核至关重要。视觉语言模型 (VLM) 集成了视觉识别和语言推理,无需特定任务的训练数据即可运行,这使得它们适合适应性强的 ODD 感知。为了评估 VLM 是否可以充当适应不断发展的定义的零样本“ODD 传感器”,我们贡献了(i)在自定义数据集和 Mapillary Vista 上使用四个 VLM 进行零样本 ODD 分类和检测的实证研究,以及故障分析; (ii) 通过成本绩效概述消除零样本优化策略; (iii) 一套可重复使用的提示模板以及适应指导。我们的研究结果表明,通过角色分解进行定义锚定的思维链提示效果最好,而其他方法可能会导致召回率降低。总体而言,我们的结果为安全关键应用中透明且有效的基于 ODD 的感知铺平了道路。