论文
VANTAGE-Bench:评估视觉语言模型中的基础设施 AI 差距
VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models
摘要
随着视觉语言模型 (VLM) 向物理部署迈进,重点仍然是在以主题为中心的消费者视频上评估的面向行动的嵌入式人工智能。这忽视了物理人工智能的普遍类别:基础设施人工智能,它依赖于固定摄像头来获得开环洞察,例如安全监控和操作日志记录。我们推出了 VANTAGE-Bench,这是衡量“基础设施人工智能差距”的基准。它跨越三个操作领域(物流、运输和智能空间),统一了跨语义、空间、时间和时空能力的图像和视频评估,并从多项选择转向八个任务公式,包括密集字幕和时空基础。它为单目标跟踪添加了单通道轨迹协议,据我们所知,这是对固定摄像机基础设施视频的首次此类评估,针对专业跟踪器进行评分。注释跨越 3,346 个媒体资产的三种机制:3,342 个视频任务注释、4,281 个图像定位标注和 27,404 个检测框。通过零样本评估 17 个模型,我们发现相对于以消费者为中心的基准的差距是集中的,而不是普遍的。事件验证、指代表达和时间定位在每个模型尺度上大约下降 9 到 24 分,而视频问答保持在 VideoMME 的 5.3 分之内,并且 2D 空间指向与 BLINK 相比并不存在差距。从绝对值来看,时间支柱是最弱的:没有系统在时间定位上超过 55.7 mIoU 或在密集视频字幕上超过 37.3 SODA_c。在跟踪方面,前沿模型在短视域内与专业跟踪器的误差大约在 5 个点内,但随着视域的延伸而分开。开放权重模型直接引导 2D 对象定位,因此规模和专有访问都无法解释该模式。数据、评估工具和排行榜:https://vantage-bench.org/