论文
具有专用分段功能的 Grounding Agent VLM,用于细粒度车辆损坏评估
Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment
摘要
视觉语言模型(VLM)越来越多地被部署为现实世界视觉评估管道中的推理代理,但它们的空间基础对于细粒度、视觉模糊的目标仍然不可靠。我们在自动车辆损坏评估的背景下研究这一差距,其中划痕和细纹裂纹等细粒度缺陷占据很少的像素,产生微弱的梯度信号,并且很容易与反射和表面纹理混淆。我们表明,最先进的 VLM (Qwen-VL) 在这项任务中实现了很高的语义分类精度 (87.3%),但在空间层面上没有系统性的基础:它会产生反射区域的损伤,完全错过拉长的划痕,并在提示定位时产生空间不一致的输出。我们提出了 TinyDamage,一种混合架构,它将空间基础委托给专用的多任务分割模型,同时保留 VLM 用于语义推理和报告生成。在分割方面,我们发现损失函数的选择对微小物体视觉定位具有巨大且尚未充分研究的影响:广泛用于类别不平衡的焦点损失,使微小损伤检测性能降至零,而监督对比目标可显着提高损伤/背景可分离性。我们将分割模型集成到 7 节点 LangGraph 代理管道中,该管道为分割输出中的每个 VLM 生成步骤奠定了基础,并表明,在对 100 份人工验证报告的受控评估中,这种基础将报告幻觉率从 92%(仅文本)和 78%(仅图像)降低到 31%。我们引入了 DET_l,这是一种允许的每类别检测指标,用于评估类别不平衡下的微小对象视觉定位,并报告已部署管道的延迟和可靠性特征。