论文

超越排行榜:域转移下端到端和 VLA 驱动策略的反事实诊断

Beyond the Leaderboard: Counterfactual Diagnosis of End-to-End and VLA Driving Policies Under Domain Shift

模型评测评测方法与指标

摘要

端到端和视觉语言行动 (VLA) 驱动策略通过排行榜排名进行比较,但排名报告的是结果,而不是其背后的行为,因此它很难预测策略在新站点上的表现。在六项已发布的策略中,nuScenes 开环错误或 NAVSIM 排行榜上的排名不会延续到新地点自我走廊附近有行人的场景。我们提出了反事实检查:几百个真实帧,每个帧都有两种编辑方式(行人被移除,或通过夜间扰动重新照亮),每个编辑都由独立检测器验证,计划轨迹的变化被解读为诊断而不是分数。从这些编辑中可以读出两个因果轴,并在它们的基础上进行五项检查,将分数合并的内容分开:政策计划行驶多远,看到行人是否会带来安全,这种反应是否会随着危险而变化,计划是否会在没有需要时改变,以及不相关的照明变化会改变它多少。在 246 个 NAVSIM 近行人场景中,在行人位于计划路径上的单元格中,只有 1.9% 的响应是真正的回避,并且在我们的开环协议下,每个策略的中位间隙变化最多为 0.03 m,计划距离的中位变化最多为 0.08 m。在从左驾驶到右驾驶的预先注册测试中,曝光和特异性顺序、照明判定和碰撞结果会转移,而点值和危险敏感性判定则不会。作为一份选择报告,这些简介说明了哪种策略是安全的,因为它计划较短,可以覆盖类似人类的距离而不屈服,并且在不需要做出反应的变化下不稳定,并且它们对每个判决进行定价:大多数在几十帧内稳定下来,危险敏感性需要数百帧。代码和编辑后的框架将被发布。