论文

RankGround:通过轻量级重排序引导作物选择实现高效的高分辨率 GUI 基础

RankGround: Efficient High-Resolution GUI Grounding via Lightweight Reranker-Guided Crop Selection

上下文与知识上下文工程

摘要

图形用户界面(GUI)基础是多模式代理的一项基本感知任务,使它们能够解释自然语言指令并与数字界面交互。现有方法面临着准确性和效率之间的根本权衡:直接全图像推理通常无法捕获小型或视觉上相似的 UI 元素,而多裁剪策略则以每次查询多次昂贵的视觉语言模型 (VLM) 调用为代价来改进本地化。为了应对这一挑战,我们提出了 RankGround,这是一个两阶段框架,可以通过每个查询的单个 VLM 调用来实现准确的 GUI 基础。我们方法的核心是 GroundRanker,这是一种轻量级的多模式重新排序器,可以从密集的候选集中识别出最有前途的作物。由于没有现成的排名数据集,我们从现有的基础数据集中构建排名监督数据。严格的包含标准和边界感知的积极增强可以改善杂乱布局中的对齐和空间覆盖。然后,GroundRanker 采用两阶段课程进行训练:逐点目标首先学习粗略遏制,列表目标细化视觉上相似作物之间的微妙语义和空间区别。实验结果表明,RankGround 始终优于强大的基线,同时降低了计算成本。与所有主干网和屏幕比例上的第二佳方法相比,它的推理速度提高了 1.4 倍,定位精度平均提高了 5.5%,在 GUI 基础的效率和精度方面建立了新的技术水平。