论文

动态仪表读数难题:视觉语言模型在运动场景中的失效

Lost in Motion: Vision Language Models Fail the Dynamic Gauges Test

模型评测模型能力评测

摘要

工业制造的数字化转型越来越依赖于自主机器人与传统基础设施(尤其是模拟仪表)交互的能力。视觉语言模型(VLM)有潜力为仪表读数提供通用解决方案,并且已经在仪器识别方面表现出良好的性能。然而,执行准确、实时的仪表读数是一项更为复杂的任务。本文根据一组简单但现实的动态仪表读取场景评估了最先进的模型,包括 GPT-5(5.4 Thinking 和 5.3 Instant)和 Gemini 3(Pro 和 Flash)系列的版本。为了促进这一评估,我们引入了一个新颖的数据集,其中包含三种不同仪表类型的仪器的视频序列:圆形、线性和游标,在不同的运动和速度曲线下。我们的研究结果表明,在我们特定的测试条件下,评估的前沿 VLM 表现出解释针轨迹和尺度语义的能力有限,无法提供安全关键监测所需的可追溯性和可靠性。结果表明,这些模型尚未达到现有 IEEE 和 ISO 标准下被归类为值得信赖的合成仪器所需的性能。