论文
一次前向计算胜过两次:InnerZoom实现准确高效的GUI目标定位
One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding
摘要
基于 MLLM 的 GUI目标定位方法通常将目标定位制定为自回归坐标生成,使模型能够利用 MLLM 强大的指令跟踪和语义理解能力。然而,这个公式要求模型保留区域级目标证据,同时以 GUI 单击所需的空间精度解码坐标标记。我们的诊断分析表明,目标区域意识出现在中间解码器层中,但既没有保留也没有转化为最终的坐标预测。现有的 ZoomIn 风格的方法通过外部裁剪和重新运行通道解决了这个问题,这改进了定位,但增加了端到端延迟和计算成本。为了在不产生额外成本的情况下保留两遍缩放的准确性优势,我们提出了 InnerZoom,一种用于跨层证据桥接的单前向框架。 InnerZoom 将原始前向传递中的目标相关线索转换为紧凑的跨层证据状态,然后在后续解码层中保留、细化和重新注入该状态以指导坐标预测。大量的实验结果表明,InnerZoom-4B 在所有六个 GUI目标定位基准测试中都实现了最先进的性能,在 OSWorld-G 上获得了 64.7 分,在 UI-Vision 上获得了 40.2 分,在 OSWorld-GR 上获得了 73.1 分,在 MMBench-GUI 上获得了 87.6 分,分别比之前的最佳成绩高出 4.1、3.2、2.9 和 2.3 分。在受控的 4B 设置下,InnerZoom 将相同的 SFT+RL 基线平均提高了 5.3 个点,并且比两次通过的 ZoomIn 平均提高了 1.3 个点,同时将端到端延迟降低了高达 31.8%,将 TFLOP 降低了约 29%。代码和模型将公开。