论文
GUI-Lens:使用通用 VLM 进行 GUI 基础的粗略裁剪
GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs
摘要
GUI 界面定位将自然语言指令映射到点击位置,对于可靠的 GUI智能体 至关重要。在高分辨率、元素密集的界面上,该任务仍然很困难,因为视觉语言模型 (VLM) 可能会识别所请求的控件,但无法足够精确地定位它以进行交互。大多数现有方法提供各种形式的定位帮助,但仍然依赖于直接点击预测,从而导致视觉模糊或不准确的初始估计传播到最终结果。在本文中,我们介绍了 GUI-Lens,这是一种从粗到细的基础框架,允许通用 VLM 通过主动视觉观察来确定目标。具体来说,GUI-Lens 从屏幕截图中提取 OCR 文本和检测到的 UI 组件,并将它们的位置显示为坐标参考。使用指令、当前视图和这些参考,VLM 选择下一个视图的区域和比例,该视图被裁剪和放大以提供更精细的视觉细节。这个过程在连续聚焦的视图上持续进行,直到确定目标。在整个过程中,将根据指令检查建议的裁剪和点击,并将最终的本地位置映射回原始屏幕坐标。对四个 GUI 界面定位基准测试和三个通用 VLM 后端的实验表明,GUI-Lens 将整体界面定位精度提高了高达 24.9 个百分点,并通过 GPT-5.5 实现了最先进的性能。