论文

GUI 基础的循环潜在视觉搜索

Recurrent Latent Visual Search for GUI Grounding

智能体系统Agent 环境交互

摘要

GUI 视觉定位是由视觉语言模型支持的 GUI 智能体的一项关键功能,可帮助它们通过在屏幕截图中定位相应元素来执行用户指令。单步视觉定位难以应对小元素和密集布局,从而激发了多步视觉搜索。然而,现有方法通常依赖于与视觉空间不一致的文本推理或与外部视觉工具进行昂贵的多轮交互。为了使多步视觉搜索成为模型内的显式空间过程,我们提出了 ReLaViS,它在单轮交互中执行循环潜在视觉搜索。在每一步中,空间搜索头都会使用隐藏状态来查询屏幕截图的视觉token,从而生成明确表示搜索焦点的空间搜索分布。然后,该分布将视觉token聚合成潜在的视觉证据,该证据会作为下一个输入嵌入循环反馈以条件后续搜索。我们进一步通过从平面元素注释构建的轨迹引入了 GUI 感知的从粗到细的归纳偏差,监督从全局界面通过中间元素组到目标的搜索。 ReLaViS 基于 Qwen2.5-VL-7B 构建,将 ScreenSpot-Pro 的准确度提高了 3.1 个百分点,达到 56.3%,推理 FLOP 只增加了 3.5%,并且在所有五个基准测试中均优于匹配的单步基准。

GUI 基础的循环潜在视觉搜索的原论文方法或结果图
图 2:ReLaViS 的推理流程。在步骤$t$,空间搜索头使用从隐藏状态导出的查询$Q_{t}$来关注视觉token $V$,产生搜索分布$s_{t}$。该分布代表搜索焦点,并将 $V$ 聚合为潜在视觉证据 $z_{t}=s_{t}^{\top}V$,用作下一个输入嵌入来条件后续搜索。在 $T$ 步骤之后,确定性读出将 $s_{T}$ 映射到单击坐标。在单个自回归序列中,搜索焦点从全局界面通过元素组发展到目标,如顶部热图所示。