论文
PaveBench:路面受压感知和交互式视觉语言分析的多功能基准
PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis
摘要
路面状况评估对于道路安全和维护至关重要。现有研究已取得重大进展。然而,大多数研究都集中在传统的计算机视觉任务上,例如分类、检测和分割。在现实应用中,路面检查需要的不仅仅是视觉识别。它还需要定量分析、解释和交互式决策支持。当前的数据集有限。他们专注于单峰感知。它们缺乏对多轮交互和基于事实的推理的支持。他们也没有将感知与视觉语言分析联系起来。为了解决这些限制,我们引入了 PaveBench,这是一种针对现实世界高速公路检查图像进行路面破损感知和交互式视觉语言分析的大型基准。 PaveBench 支持四个核心任务:分类、对象检测、语义分割和视觉语言问答。它提供统一的任务定义和评估协议。在视觉方面,PaveBench 提供大规模注释,并包含用于鲁棒性评估的精选硬干扰子集。它包含大量真实世界的路面图像。在多模态方面,我们引入了PaveVQA,这是一个支持单轮、多轮和专家校正交互的真实图像问答(QA)数据集。它涵盖识别、定位、定量估计和维护推理。我们评估了几种最先进的方法并提供了详细的分析。我们还提出了一个简单有效的代理增强视觉问答框架,它将特定于领域的模型作为工具与视觉语言模型集成在一起。该数据集位于:https://huggingface.co/datasets/MML-Group/PaveBench。