论文

AutoFocus:用于 GUI 目标定位的不确定性感知主动视觉搜索

AutoFocus: Uncertainty-Aware Active Visual Search for GUI Grounding

模型推理推理搜索与路径规划

摘要

视觉语言模型 (VLM) 启用了自主 GUI智能体,将自然语言指令转换为可执行的屏幕坐标。然而,高分辨率界面的目标定位性能会下降,其中密集的布局和小的交互元素暴露了现代显示器和模型输入约束之间的分辨率差距。现有的放大策略依赖于固定锚点、启发式网格或强化学习,缺乏原则机制来自适应地确定哪里需要细化以及应该探索多少空间不确定性。我们提出了 AutoFocus,一个 无需训练,用于 GUI 目标定位的不确定性感知主动视觉搜索框架。我们的主要见解是,坐标生成中的 词元级 困惑自然地反映了空间不确定性。 AutoFocus 不是致力于单一预测,而是对多个坐标假设进行采样,并将其轴向困惑度转换为各向异性高斯空间概率场,明确地模拟方向不确定性。基于这个领域,我们生成全局和局部区域建议,并引入形状感知缩放来平衡紧密的本地化和上下文保留。然后,基于视觉提示的聚合步骤通过结构化比较选择最一致的预测。 ScreenSpot-Pro 和 ScreenSpot-V2 上的大量实验证明了通用 VLM 和 GUI 专用 VLM 的一致改进。