论文

微调 视觉语言模型,用于通过 Quality Guard Agent 了解当前损坏和评分优先级

Fine-Tuning Vision-Language Models for Understanding Current Damage and Scoring Priority with Quality Guard Agent

应用与实践行业应用

摘要

日本的桥梁检查要求每五年进行一次强制性目视评估,但不同工程师指定的定性损坏评级(a-e 级)表现出显着的评估者间差异,这是基础设施管理一致性的关键障碍。熟练工程师的老龄化进一步威胁着检验能力。本文提出了一种使用微调视觉语言模型 (VLM) 自动理解桥梁损伤和修复优先级评分的方法。我们使用 QLoRA 对多达 4,000 个配对的桥梁损伤图像和检查文本记录对 LLaVA-1.5-7B 进行微调,然后在包含 800 个图像的固定测试集​​上进行评估。该模型输出识别结构构件和损坏模式的自然语言描述,基于规则的评分引擎从中计算出五级修复优先级指数。渐进式训练研究(1k/2k/3k/4k 样本)表明,2k 训练样本仅需 2.9 小时的训练即可实现接近最优的验证损失;超过 2k 时,训练样本每增加一倍,验证损失改善不超过 0.2%,表现出明显的收益递减。此外,保留测试集的语义相似度在 3k (0.6909) 时达到峰值,在 4k (0.6739) 时下降,这表明质量管理的中规模数据优于更大但噪音更大的语料库。结合 torch.compile() 和批处理 (batch_size=8) 的推理优化实现了每个图像 10.06 秒,比未优化的基线减少了 70.2%。我们的方法有助于桥梁检查中的数据治理,减少评估者之间的差异,并提供人工智能辅助分类以增强检查工作流程中的专家工程师。此外,我们引入了两级质量防护,使用经过微调的 Swallow-8B SLM 在优先评分之前拒绝低质量的 VLM 输出,从而防止损坏或无法识别的图像产生虚假分数。