论文

基础裂缝:挑战视觉基础模型的民用基础设施数据集

Cracks in the Foundation: A Civil Infrastructure Dataset to Challenge Vision Foundation Models

模型评测基准与评测资源

摘要

自动化结构健康监测对于防止灾难性基础设施故障至关重要。需要精确的像素级缺陷分割来准确评估结构完整性,但民用基础设施缺陷分割的进展因数据极度缺乏而受到阻碍,这需要昂贵的专家注释。该问题固有的算法障碍加剧了对数据的需求,包括中心偏差以及在检查几乎无纹理的建筑材料时需要更多地依赖形状。为了消除这一瓶颈,我们引入了 Cracks in the Foundation (CiF),这是迄今为止最大、最详细的土木基础设施(实例)分割数据集,其中包含与土木工程专家合作五年来精心策划的价值约 150,000 美元的高分辨率图像。借助这个前所未有的数据源,我们暴露了当前视觉人工智能的盲点:尽管出现了快速基础模型(FM)和视觉语言模型(VLM),尽管当今的专业分割模型具有令人印象深刻的能力,但事实证明,建筑环境中的密集图像理解远未得到解决。我们的评估表明,即使是最新的零样本 FM 在部署在现实世界的基础设施上时也面临着重大挑战,甚至在特定领域的监督稳定在 $\approx$25% mAP 的专用模型的性能上也面临着重大挑战。 CiF 建立了对民用基础设施的检查,这是一项基本且看似简单的感知任务,作为一项公开挑战,揭示了当前主要基于互联网图像训练的模型的根本弱点,从字面上和形象上强调了当前基础模型范式中的裂缝。