论文
用于自动驾驶的带有 LLM 注释的高风险驾驶场景的知识增强数据集
A knowledge-augmented dataset of high-risk driving scenarios with LLM annotations for autonomous driving
摘要
安全的自动驾驶既需要对常见的高风险事件做出快速响应,又需要对交通安全中罕见的极端长尾场景进行更深入的推理。这些场景在自然驾驶数据中的代表性严重不足,并且现有的轨迹和语言增强数据集很少提供高风险事件标签、语义注释和可验证的安全信号。在这里,我们介绍 K-Risk,这是一个知识增强数据集,它将结构化驾驶轨迹与 大语言模型 为安全关键驾驶场景生成的语义注释相结合。 K-Risk集成了来自欧洲、中国和美国的20个人类驾驶和自动驾驶车辆轨迹数据集,涵盖高速公路、城市高速公路、十字路口和环岛。 K-Risk 使用统一的以风险为中心的提取管道,整理了 31,398 个高风险事件,以及 1,036 个接近碰撞案例的极端子集。每个事件都以同步轨迹、元数据和语言三元组的形式发布,其中包含结构化场景描述、异常行为通知,并且对于代表性子集,通过具有迭代反射的闭环模拟器验证因果风险分析和行动建议。通过结合多维风险标注、可解释的语言监督和可验证的决策,K-Risk 连接了结构化交通轨迹、语义推理和决策监督,为开发和评估下一代风险感知自动驾驶代理提供了标准化基础。