论文

GUI 基元:诊断视觉语言 GUI 基础中的空间推理失败

GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

模型评测基准与评测资源

摘要

计算机使用代理根据屏幕截图中的自然语言指令来定位界面元素,但现有的基准测试并不能隔离模型是否将关系语言绑定到正确的元素。我们引入了 GUI-Primitives,这是图形用户界面中七种空间关系(左/右、上/下、包含、对齐、邻近、列表序数、遮挡)的对比指令对的 994 项基准。每对都固定屏幕截图和锚点,同时更改关系表达式,因此正确的目标在两个指定的候选者之间移动。五个注释者验证 196 项子集($κ= 0.94$ 格式良好;$κ= 0.79$ 目标选择)。 19 个视觉语言模型最多达到 $32\%$ 严格的框内点精度。由于模型发出不受约束的坐标,因此我们根据每个预测所属的候选区域对其进行分类。对于 $60-92\%$ 的项目,两位候选人的预测均超出了预期。以落入候选区域为条件,水平位置、垂直位置、邻近度和列表序数的目标选择达到 0.82-0.90,但与包含和遮挡的 0.50 没有显着差异:大多数失败反映候选定位而不是关系理解。在十个模型中,基准测试准确度与 ScreenSpot-Pro 准确度相关(Spearman $ρ= +0.74$),这是该样本量下的探索性关联。标记两个指定的候选者可以将选择准确性提高 35--57 个百分点,这是一种提供候选集而不是可部署方法的预言机诊断。我们发布基准、预测和代码。