论文

LookAgain:通过视觉反思实现闭环GUI定位

LookAgain: Closed-Loop GUI Grounding with Visually Grounded Reflection

模型推理推理验证与自校正

摘要

现有GUI定位模型在标准基准上的单次预测准确率提高,但在小目标、密集控件及分布外界面上仍明显退化。本文认为,模型通常不会将输出坐标作为待验证的假设,并根据新视觉证据修正。具体问题包括缺乏预测后反思、辅助视觉证据仅服务于下一次坐标而非核验已输出坐标,以及迭代缩放只细化观察区域、不继承此前坐标以作修正。LookAgain将定位改为多轮“预测—再观察—修正”流程:“locate”提出坐标假设,在图像中标记并提供局部裁剪,下一轮继承该预测作为空间先验;“confirm”接受或拒绝假设并结束流程。模型先用构造的反思轨迹做监督微调,再以最终定位正确性为唯一奖励做GRPO训练。实验在考虑拒答及通用GUI定位基准上取得领先结果,消融支持各机制的有效性。