论文

接下来测试什么:驱动 VLM 中的可解释覆盖间隙发现

What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs

模型评测评测方法与指标

摘要

驱动视觉语言模型 (VLM) 必须准确理解操作设计域 (ODD) 定义的不同条件下的场景,但验证仍然稀疏:许多切片缺失,导致经验故障率不可靠。我们提出了 SliceScorer,这是一种用于缺失切片推荐的确定性评分规则,它结合了(i)优先考虑稀有、未测试区域的基于暴露的覆盖范围,以及(ii)传播来自类似测试条件的风险的邻居失败先验。 SliceScorer 故意简单 - 可解释、可审计和保守 - 对于安全关键验证至关重要的属性。对于超出声明的 ODD 的压力测试,我们将 SliceScorer 嵌入到 SliceNav 中,这是一个 LLM 精心设计的验证管道,其中模型解释开发人员查询以选择相关运算符(分类、评分、采集、评估)和词汇扩展,组成验证工作流程,同时保持所有评分的确定性和可审计性。对三种驱动 VLM(WiseAD、DriveMM、Cosmos-Reason2-2B)的实验表明,SliceNav 比之前的切片发现方法更有效地显示高风险覆盖间隙,同时在条件空间中保持多样化的建议。消融确认了两个评分组件的贡献,定性分析演示了从开发人员查询到有针对性的评估的端到端工作流程。