论文

GUI-Eyes:面向GUI代理视觉定位的工具增强感知

GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents

模型训练强化学习Agentic RL

摘要

视觉-语言模型(VLM)与强化学习(RL)的最新进展推动了GUI自动化的进步。然而,大多数现有方法依赖静态、一次性视觉输入与被动感知,缺乏自适应决定何时、是否以及如何观察界面的能力。我们提出GUI-Eyes,一个面向GUI任务中主动视觉感知的强化学习框架。为获取信息更丰富的观察,代理学会在两阶段推理过程中就是否以及如何调用裁剪、缩放等视觉工具做出策略性决策。为支撑这一行为,我们引入渐进式感知策略,把决策分解为粗探索与细粒度定位,由两级策略协调。此外,我们设计了面向工具使用的空间连续奖励函数,整合位置接近度与区域重叠,提供稠密监督,缓解GUI环境常见的奖励稀疏问题。在ScreenSpot-Pro基准上,GUI-Eyes-3B仅用3k标注样本即达到44.8%的定位准确率,显著超越监督与RL基线。这些结果凸显:由分阶段策略推理与细粒度奖励反馈赋能的工具感知主动感知,对构建稳健且数据高效的GUI代理至关重要。

GUI-Eyes:面向GUI代理视觉定位的工具增强感知
图2:GUI-Eyes 框架总览。上半部分展示一个带可选视觉工具调用的 rollout 示例,以及一个结合相对真实标注(ground-truth)的空间接近度与区域重叠的工具专属奖励函数。下半部分描绘渐进式推理架构与端到端训练流程,其中两阶段决策过程由阶段专属提示引导,视觉输入通过先前应用的视觉工具动态生成。