论文

UI-Zoomer:用于 GUI 基础的不确定性驱动的自适应放大

UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding

模型推理测试时计算扩展

摘要

GUI 基础(根据自然语言查询的屏幕截图来本地化界面元素)对于小图标和密集布局仍然具有挑战性。测试时放大方法通过以更高分辨率裁剪和重新运行推理来改进定位,但在具有固定裁剪尺寸的所有实例上统一应用裁剪,忽略模型在每种情况下实际上是否不确定。我们提出了 \textbf{UI-Zoomer},一个 无需训练 自适应放大框架,它将放大的触发和规模视为预测不确定性量化问题。置信感知门将随机候选者之间的空间共识与 词元级 生成置信度融合在一起,仅在定位不确定时才选择性地触发放大。触发时,不确定性驱动的裁剪尺寸模块将预测方差分解为样本间位置分布和样本内框范围,通过总方差定律得出每个实例的裁剪半径。 ScreenSpot-Pro、UI-Vision 和 ScreenSpot-v2 上的大量实验表明,在多个模型架构中,其在强基线上取得了一致的改进,分别实现了高达 +13.4\%、+10.3\% 和 +4.2\% 的增益,且无需额外训练。