论文
用于模拟仪表读数的视觉语言模型:专业化、传递和可靠性的实证研究
Vision-Language Models for Analog Gauge Reading: An Empirical Study of Specialization, Transfer and Reliability
摘要
模拟仪表在手动检查成本高昂或危险的工业环境中仍然很常见。这里讨论的工程应用是单目标模拟测量图像的直接数值读取,而人工智能的贡献是对通用视觉语言模型(VLM)的专业化、传输、鲁棒性和可靠性的系统评估,而无需明确的指针分段和几何读取管道。 Qwen2.5-VL-7B-Instruct 模型使用零样本提示、上下文学习 (ICL) 和参数高效的 微调 以及量化低秩适应 (QLoRA) 在公共合成数据集、视频衍生的压力计数据集和专有工业数据集上进行评估。所有 微调 实验均使用固定的 20 epoch 协议,并使用最终 epoch 进行分析;带和不带仪表范围的单独型号消除了提示设置的混乱。主要指标是范围归一化平均百分比误差 (MPE)。合成数据集上的最佳微调 MPE 值为 2.39%,95% 自举置信区间 (CI) 为 1.43-3.90%;压力表数据集为 2.61%,CI 为 1.66-3.80%;专有工业数据集上的 CI 为 4.43%,CI 为 2.31-7.14%。留一数据集实验揭示了保留的合成和专有数据的传输性能大幅下降,而稳健性测试将高斯模糊确定为最强的测试损坏。可靠性分析表明,高置信度错误仍然可能存在,从而导致在安全关键用途中放弃并进行独立验证。这些结果支持 QLoRA 专用 VLM 进行直接单仪表读数,但尚未成为可部署的工厂监控管道。