论文

V2P:通过背景抑制与中心聚焦实现 GUI 定位的视觉注意力校准

V2P: Visual Attention Calibration for GUI Grounding via Background Suppression and Center Peaking

模型训练监督微调与指令调优

摘要

GUI 元素的精确定位对 GUI Agent 的发展至关重要。传统方法依赖边界框或中心点回归,忽视了空间交互的不确定性与视觉-语义层级。近期方法引入了注意力机制,但仍面临两个关键问题:(1)忽略对背景区域的处理会导致注意力漂离目标区域;(2)对目标 UI 元素进行均匀建模,无法区分其中心与边缘,导致点击不精确。受人类视觉处理和与 GUI 元素交互方式的启发,我们提出 Valley-to-Peak(V2P)方法来解决这些问题。为减轻背景干扰,V2P 引入抑制注意力机制,将模型对无关区域的关注降到最低,以突出目标区域。针对中心-边缘区分问题,V2P 采用受费茨定律(Fitts' Law)启发的方法,将 GUI 交互建模为二维高斯热图,权重从中心向边缘逐渐衰减。权重分布服从高斯函数,方差由目标大小决定。由此,V2P 能有效分离目标区域,并教会模型聚焦于 UI 元素最关键的点。经 V2P 训练的模型在 ScreenSpot-v2 和 ScreenSpot-Pro 两个基准上分别取得 92.4% 和 52.5% 的成绩(见 Fig.~\ref{fig:main_results_charts})。消融实验进一步证实了各组件的贡献,凸显了 V2P 在精确 GUI 定位任务中的泛化能力及其在未来 GUI Agent 中实际部署的潜力。

V2P:通过背景抑制与中心聚焦实现 GUI 定位的视觉注意力校准 配图
图 2:谷-峰训练方法(Valley-to-Peak, V2P)。V2P 通过两种策略联合抑制噪声并增强信号:逆注意力惩罚在非目标区域刻出“谷”,而尺寸自适应的 Fitts-高斯峰在 UI 元素中心形成尖锐的“峰”。这种双重方法重塑注意力图(最右侧示例),使模型能够在杂乱的界面中快速定位交互点。