论文

doPlan:自动驾驶中多阶段语言条件规划的可变水平数据集

doPlan: A Variable-Horizon Dataset for Multi-Stage Language-Conditioned Planning in Autonomous Driving

模型评测基准与评测资源

摘要

通过自然语言与乘客互动的自动驾驶车辆必须进行超越即时命令的推理。乘客意图可能跨越行为的多个阶段,取决于未来事件,参考周围的Agent或地标,并随着驾驶条件的变化而保持相关性。现有的支持语言的驾驶数据集主要关注短期的本地化交互,而这些长期形式的乘客意图相对而言尚未得到充分探索。我们引入了 doPlan,据我们所知,这是第一个公开可用的、人工注释的现实世界数据集,旨在研究乘客语言作为持久任务上下文。 doPlan 基于 nuPlan 构建,包含 5,154 条人工编写的乘客指令,涵盖 169.1 小时的累积指令对齐上下文,超过 50.9 小时的独特驾驶,注释窗口范围从 30.0 到 508.8 秒。注释捕获即时、延迟、事件条件、持久和多阶段的乘客意图。数据集、注释接口和支持资源可在 https://github.com/Mi3-Lab/doPlan. 上公开获得。我们评估了四种语言条件驾驶模型,发现对乘客语言的敏感性并不能可靠地转化为与所请求的方向一致的行为。更广泛地说,在 2,161 个具有匹配的未来机动的示例中,第一个相关机动发生在评估点之后的中位数 24.6 秒内,并且只有 9.8% 发生在模型的共同 5 秒预测范围内。这些发现强调需要将持续的乘客意图与连续的规划决策联系起来。 doPlan 提供了一个设置,用于研究如何保留未解决的目标,以不断变化的场景为基础,并在多个阶段进行跟踪,包括规划者如何确定未来目标何时与当前计划相关。