论文
先评判再点击:GUI目标定位中提议器与视觉评判器的协同训练
Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
摘要
图形用户界面(GUI)目标定位需要将自然语言指令映射到精确的像素坐标。然而,由于视觉上同质的元素和密集的布局,模型通常能够掌握语义意图,但难以实现精确的定位。虽然缩放采样尝试 (Pass@k) 揭示了潜在的收益,但源自几何聚类的静态自一致性策略通常产生有限的改进,因为模型的预测往往在空间上分散。在本文中,我们建议用可学习的选择机制取代静态一致性策略,该机制通过批评屏幕截图上呈现的自己的建议来选择最佳目标。鉴于模型的目标定位能力和候选评判能力之间存在显着差异,我们提出了一个共同发展的“先提出建议,后批评”框架。为了共同优化这些,我们引入了成熟度感知的自适应共同进化强化学习范例。这种方法动态地平衡了提议者和批评者的训练目标,其中提议者输出的多样性增强了批评者的鲁棒性,而批评者成熟的辨别能力反过来释放了提议者广泛空间探索的潜力,促进了两种能力的相互强化和共同进化,从而确保了适应多样化和复杂界面布局的泛化性。超过 6 个基准的大量实验表明,我们的方法显着提高了目标定位精度和评判器可靠性。