论文

推理模型尚未遵循自动驾驶中的推理:KITScens LongTail 数据集

Reasoning models do not yet follow their reasoning in autonomous driving: The KITScenes LongTail Dataset

模型评测基准与评测资源

摘要

处理罕见事件是自动驾驶面临的核心挑战。推理模型在行动之前生成明确的推理链,有望推广到此类事件。在这里,我们表明这些模型经常不遵循自己的推理:它们在推理中陈述的操作通常与它们最终执行的操作不同。我们引入了 KITScenes LongTail,这是一个罕见驾驶场景的精选数据集,通过测量语义推理-动作一致性来量化这种差异。我们发现当前的通用模型和特定领域模型普遍存在不一致的情况。引人注目的是,当推理的动作和执行的动作不一致时,推理通常是正确的:从推理轨迹中提取动作并通过运动学模型执行它们可以增强一致性,通常可以改善运动规划。这些结果表明,当前模型的推理能力超出了其行为所揭示的能力,并且按照既定推理进行连贯行动是值得信赖的自动驾驶的先决条件。我们的数据集和评估空间位于:https://hf.co/datasets/kit-mrt/kitscenes-longtail