论文

免回归布局感知匹配实现无幻觉的GUI元素定位

Hallucination-Free GUI Grounding via Regression-Free Layout-Aware Matching

应用与实践视觉感知与空间理解

摘要

GUI智能体正从依赖元数据的大语言模型转向直接在截图上操作的纯视觉多模态大语言模型(MLLM)。其核心任务GUI定位要求将抽象的用户指令转化为精确的元素坐标。该任务面临持久的双重障碍:传统定位模型缺乏解读抽象指令所需的语义丰富性,而端到端MLLM则因细粒度感知不足而饱受坐标幻觉困扰。我们提出一个免回归框架:冻结的MLLM负责指令解析,专用定位模型在不学习任何坐标回归的情况下完成精确定位。冻结的MLLM先将抽象指令细化为富含布局线索的结构化视觉描述。这些描述随后输入新颖的布局感知GUI定位模型,通过在布局先验候选间匹配实现免回归定位,从机制上抑制幻觉并免去昂贵的微调。定位模型仅用文本/图标二分类标签训练,无需坐标回归参数。在ScreenSpot-Pro上,该方法定位准确率比端到端系统提升超过20%;在Mind2Web上,成功率和元素选择率提升超过15%。这些结果表明,将指令理解与布局感知定位解耦能有效解决GUI交互的核心挑战。

免回归布局感知匹配实现无幻觉的GUI元素定位:论文配图
图1:我们所提方法的框架。该方法集成多模态大语言模型(MLLM)来解释用户指令并生成详细的视觉描述。这些描述随后被专门设计的布局感知定位模型利用,以更高的精度确定用户界面(UI)元素的位置。