论文

WildRoadBench:视觉语言模型和自主代理的真实航拍道路损伤定位基准

WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents

模型评测基准与评测资源

摘要

我们推出了 WildRoadBench,这是一种真实航拍道路损伤定位基准,它将视觉语言模型的直接视觉视觉定位与 LLM 驱动的代理在单个专业注释的无人机语料库上的自主研究和工程结合起来。在两种协议下评估相同的图像集和相同的每类 AP_50 指标。 VLM Track 衡量固定的 VLM 是否可以在统一的提示、解码和解析管道下定位来自一张图像和一个简短提示的特定领域损坏。 Agent Track 衡量自主代理在仅给出书面任务简介、小型探索性部分和固定交互预算的情况下是否可以搜索公共网络、调整预训练组件、编写训练和推理代码以及通过隐藏的保留上的标量反馈预言机提交预测。我们对大量闭源前沿模型和开源 VLM 以及几个前沿 LLM 驱动代理进行了基准测试。在这种狂野的环境中,这两条路线都远未达到可靠的性能:闭源前沿模型在 VLM 排行榜上处于领先地位,但仍然落后一半以上的指标;开源视觉定位器的水平远低于它们,而新一代或推理风格的变体并不能持续改善视觉定位;每个开源模型的小目标都会崩溃;尽管智能体拥有更丰富的能力,但仍落后于最强大的 VLM,并且一些智能体未能在预算范围内提交有效的提交。我们在 https://anonymous.4open.science/r/wildroadbench-0607 发布代码和数据,以支持可重复的后续研究。