论文

NeuroSymbEAD:用于全方位自动驾驶的大规模神经符号字幕数据集

NeuroSymbEAD: A Large Scale Neuro-Symbolic Caption Dataset for Omni-Directional Embodied Autonomous Driving

模型评测基准与评测资源

摘要

本文介绍了 NeuroSymbEAD,这是一个大规模的神经符号标题数据集,具有以自我为中心的静态和动态对象的知识图谱 (KG),并用类、类别、前进方向、方位和距自我车辆的距离进行注释。这些注释用于 KITTI-360 数据集,以生成表示以自我为中心的场景图的轻量级版本的多级文本标题。室外场景地图重建、视觉识别和物体定位为驾驶常识和交通/场景理解建立了基线。出于这些目的,基于自然语言的对象及其复杂关系的带对象定位的场景描述是室内场景任务广泛采用的上下文表示。神经符号表示已被证明可以有效处理各种计算机视觉和语言应用的结构化信息。我们的数据注释管道允许生成各种地图片段,在任何 3D 对象检测网络预测的边界框中填充模拟或真实对象,以及构建分层文本标题。我们使用预先训练的基础和学习的自回归字幕网络对神经符号和本体字幕生成进行基准测试。通过将 3D 驾驶场景转换为结构化的以自我为中心的语言,NeuroSymbEAD 为视觉语言提供了基准,并为交通场景解释、3D 推理和可解释的自动驾驶感知提供了基础模型。