论文
GroundingBench:多分辨率多边形定位揭示视觉语言模型的几何输出差距
Groundbench: Multi-Resolution Polygon Grounding Exposes the Geometry Gap in Vision-Language Models
摘要
RefCOCO系列视觉定位任务的边界框得分已难以区分前沿视觉语言系统,但边界框忽略了物体形状。本文提出GroundingBench,将相同的1500组图像、指代表达与目标对象,转换为五种顶点预算下具有精确N个顶点的多边形任务。评测使用固定分母,分别核查填充区域交并比(IoU)和合法多边形完成情况。最强受测配置的边界框IoU为88.2、IoU≥0.5的准确率为97.1;直接生成多边形的对应分数为57.7和69.2。由于这些汇总得分使用不同参照,研究也把直接多边形与预测框栅格化结果放在同一轮廓目标上比较,汇总IoU分别为57.7和57.3。表现不随顶点数N单调变化,在顶点最密集的预算下明显崩溃,输出非法问题叠加了残余几何误差。Qwen的思考设置对比是所测试的保持输入不变的配置中差异最大的一组;固定模板下,错误空间线索比错误颜色线索更有破坏性,模型可能仍明显偏向正确目标,却不善于描绘轮廓。替代掩码和连续面积评分器保持了主要排序。因此,GroundingBench衡量的是定位、边界构造、序列化和拓扑等环节共同形成的几何输出差距,并非只测潜在边界感知能力。