论文

通过用自然语言描述图像子集之间的差异来理解自动驾驶数据集

Understanding Autonomous Driving Datasets by Describing Differences between Image Subsets in Natural Language

模型评测基准与评测资源

摘要

了解大规模自动驾驶数据集的组成对于跨领域的安全性、鲁棒性和可靠操作至关重要。例如,位置之间的域转移可能会导致操作环境与训练数据不一致,从而导致潜在的危险性能下降。然而,现有的数据分析管道在很大程度上依赖于元数据、预定义标签或手动检查,它们提供的语义洞察力有限或无法扩展。本文研究集合差异字幕:给定两个图像子集,目标是产生描述目标集和参考集之间差异的自然语言假设。在两阶段公式的基础上,我们通过专注于从对象检测中导出的以对象为中心的补丁,将该方法应用于自动驾驶,这简化了聚合并能够将差异归因于特定对象实例或类别。为了在域内评估此设置,我们引入了一个新的基准,AD-Diff Bench。低浓度实验评估了集合差异字幕方法对稀疏的现实世界差异的适用性。我们将实验限制在开放权重模型上,以支持可重复性和易于部署。所提出的基准和分析为自动驾驶数据集的实用、人类可解释的数据集内省迈出了一步。我们的实施和基准数据集可在 https://github.com/KIT-MRT/AD-Diff 获取