论文
GUI 基础的循环潜在视觉搜索
Recurrent Latent Visual Search for GUI Grounding
摘要
GUI 视觉定位是由视觉语言模型支持的 GUI 智能体的一项关键功能,可帮助它们通过在屏幕截图中定位相应元素来执行用户指令。单步视觉定位难以应对小元素和密集布局,从而激发了多步视觉搜索。然而,现有方法通常依赖于与视觉空间不一致的文本推理或与外部视觉工具进行昂贵的多轮交互。为了使多步视觉搜索成为模型内的显式空间过程,我们提出了 ReLaViS,它在单轮交互中执行循环潜在视觉搜索。在每一步中,空间搜索头都会使用隐藏状态来查询屏幕截图的视觉token,从而生成明确表示搜索焦点的空间搜索分布。然后,该分布将视觉token聚合成潜在的视觉证据,该证据会作为下一个输入嵌入循环反馈以条件后续搜索。我们进一步通过从平面元素注释构建的轨迹引入了 GUI 感知的从粗到细的归纳偏差,监督从全局界面通过中间元素组到目标的搜索。 ReLaViS 基于 Qwen2.5-VL-7B 构建,将 ScreenSpot-Pro 的准确度提高了 3.1 个百分点,达到 56.3%,推理 FLOP 只增加了 3.5%,并且在所有五个基准测试中均优于匹配的单步基准。
