论文
VISTA:面向GUI 定位的视角一致自验证训练
VISTA: View-Consistent Self-Verified Training for GUI Grounding
摘要
当应用组相对策略优化 (GRPO) 进行 GUI 基础时,部署是从单个屏幕截图视图中采样的;群体常常要么在困难的情况下全部失败,要么在简单的情况下全部成功,从而没有产生有用的相对优势。我们提出了 VISTA(视图一致的自我验证训练),这是一个基于 GRPO 的训练框架,它从同一 GUI 实例的多个目标保留视图构建每个比较组。每个视图都是由保持目标元素可见并准确地重新映射其框的裁剪生成的,因此模型的推出可以在语义上等效但几何上不同的输入之间进行比较。为了稳定短坐标生成而不将强化学习变成无条件模仿,VISTA 进一步添加了一个自我验证的交叉视图锚:一个通过优势加权损失优化的预言答案,从组基线中排除,并且仅在模型产生最大奖励推出时激活。在五个 GUI 定位基准和多个 Qwen 主干中,VISTA 持续提高锚定精度。在 ScreenSpot-Pro 上,它将 Qwen3-VL 4B/8B/30B-A3B 从 55.5/52.7/53.7 提高到 63.4/65.8/67.0。稳健性分析进一步显示出更高的最差视图准确度和更低的预测翻转率。
