论文

解码前发生了什么?预填充决定 VLM 的 GUI 目标定位

What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs

上下文与知识上下文工程

摘要

现有的 GUI 基础 无需训练 方法通常依赖于多次推理运行(例如迭代裁剪或候选聚合)来识别目标元素。尽管有这些额外的计算,每个前向传递仍然独立地解释指令并解析视觉布局,而不会在视觉标记之间启用渐进式交互。在本文中,我们研究了视觉语言模型 (VLM) 中的 GUI 基础过程中发生的情况,并确定了之前被忽视的瓶颈。我们表明,目标定位遵循两阶段范例:预填充阶段确定候选 UI 元素,而解码阶段随后细化最终坐标。这种不对称性将预填充确定为关键步骤,因为在解码过程中无法有效纠正候选选择中的错误。基于这一观察,我们提出了 Re-Prefill,这是一种 无需训练 方法,通过引入注意力引导的第二预填充阶段来重新审视推理,以细化目标选择。具体来说,跨层始终受到查询位置(即最终标记)高度关注的视觉标记被提取为初步目标假设,并与指令隐藏状态一起附加到输入,使模型能够在坐标生成之前深入重新思考其决策。四个 VLM 和五个基准测试(包括 ScreenSpot-Pro、ScreenSpot-V2、OSWorld-G、UI-Vision 和 MMBench-GUI)的实验表明,无需额外训练即可实现持续改进,ScreenSpot-Pro 的增益高达 4.3%。代码可在 https://github.com/linjiaping1/Re-Prefill 获取。