论文

用于全面自动路面状况评估的视觉语言基础模型

Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment

模型训练监督微调与指令调优

摘要

通用视觉语言模型在日常领域表现出强大的性能,但在需要精确术语、结构化推理和遵守工程标准的专业技术领域却遇到了困难。这项工作解决了特定领域的指令调整是否可以通过视觉语言模型实现全面的路面状况评估。 PaveInstruct 是一个包含 278,889 个图像-指令-响应对、涵盖 32 种任务类型的数据集,是通过统一来自 9 个异构路面数据集的注释而创建的。 PaveGPT 是一个在此数据集上训练的路面基础模型,它根据感知、理解和推理任务中最先进的视觉语言模型进行了评估。指令调整改变了模型功能,在空间基础、推理和生成任务方面实现了超过 20% 的改进,同时生成符合 ASTM D6433 的输出。这些结果使运输机构能够部署统一的对话评估工具来取代多个专用系统,从而简化工作流程并减少技术专业知识要求。该方法为跨基础设施领域(包括桥梁检查、铁路维护和建筑状况评估)开发指令驱动的人工智能系统建立了一条途径。