论文

你的长尾轨迹位移安全吗?

Is Your Trajectory Displacement Safe in Long-tail?

模型评测评测方法与指标

摘要

即使数据集增长了几个数量级,长尾场景仍然是自动驾驶评估的主要瓶颈。现有的评估流程很少同时具有人性化、安全意识、可验证性和可解释性:闭环指标通常在强大的规划者中饱和,而如果没有精心设计的协议,非结构化的人类评级可能会很嘈杂。我们将规划评估制定为附加威胁检测:给定规划器轨迹和专家参考,规划器的位移是否会引入新的不安全驾驶行为?我们提出了 FluidTest,这是一个包含三个组件的评估管道:用于可靠人工注释的成对 WebUI 协议;通过基于证据的决策图对 32 种语义威胁进行分类;以及具有精确性和可审计性反映的三代理验证系统。 WOD-E2E 数据集上的实验表明,FluidTest 在训练有素的注释器之间生成一致的标签,并在 65% 的 Poutine 轨迹和 51% 的 RAP 轨迹中识别出额外的威胁。这些结果表明,尽管评估者反馈分数 (RFS) 较高且平均位移误差 (ADE) 较低,但最先进的规划人员仍可能表现出严重的安全相关故障。其他详细信息、指南和代码可在 https://fluidtest.web.app 上获取。