论文

AVA-VLM:用于野外施工现场监控的自适应视觉注意视觉语言模型

AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring

上下文与知识上下文工程

摘要

现有的施工现场视觉语言模型(VLM)研究主要通过来自单个全局图像的直接 QA 式 微调 来适应预训练的 VLM,但我们认为这种范式在操作范围、降低分辨率输入下的可靠性和推理效率方面仍然受到限制。为了解决这些限制,我们提出了 AVA-VLM,一种自适应视觉注意视觉语言模型,它遵循受人类启发的从粗到细的策略:它首先对低分辨率全局图像进行推理,仅在需要详细检查时才请求高分辨率局部裁剪。我们进一步引入了一个区域感知的思想链数据集,该数据集教导何时检查、在哪里裁剪以及如何使用本地证据。实验表明,对于违规识别,AVA-VLM 将整体 F1 从 62.0 提高到 75.1,同时仅使用基线视觉 词元预算 的 30.6%;对于长途违反 PPE 的情况,F1 从 16.0 提高到 63.6。这些结果表明,AVA-VLM 对远距离和分辨率降低的视觉证据的鲁棒性得到了提高,同时视觉标记的使用量显着降低。