论文

DRS-GUI:免训练GUI定位的动态区域搜索

DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding

智能体系统Agent 环境交互

摘要

由多模态大语言模型(MLLM)驱动的GUI智能体在理解与执行用户指令方面展现出令人印象深刻的能力。然而,对现有方法而言,从充斥无关UI组件的高分辨率截图中准确定位与指令相关的元素仍然具有挑战性。受人类动态调整感知范围以在复杂屏幕上定位任务相关区域的方式启发,我们提出DRS-GUI,一个可无缝集成到现有MLLM中的免训练GUI定位动态区域搜索框架。DRS-GUI引入轻量级UI感知器(UI Perceptor),执行三种类人感知动作(聚焦Focus、转移Shift与发散Scatter),渐进式探索界面并生成区域提议。为动态调度这些动作,我们进一步设计了基于蒙特卡洛树搜索(MCTS)的动作规划器。采用区域质量奖励来评估并选择与指令高度相关的区域,高效剪除冗余UI元素。实验表明,DRS-GUI使通用与GUI专用MLLM(Qwen2.5-VL-7B与UGround-V1-7B)在ScreenSpot-Pro上获得14%的提升,显著增强了定位性能与泛化能力。

DRS-GUI:免训练GUI定位的动态区域搜索:论文配图
图 1:(a) 单阶段方法通过仅向前聚焦逐步裁剪和缩放,导致误差累积。 (b) DRS-GUI 使用动作规划器和 UI 感知器通过三个感知动作探索区域,在区域质量评估的指导下选择与指令相关的区域。