论文
PAGER:弥合点精确几何GUI控制中的语义-执行鸿沟
PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control
摘要
大型视觉语言模型显著推进了GUI智能体的发展,使其能够在网页、移动与桌面界面上进行可执行的交互。然而,这些进展在很大程度上依赖宽容的区域容忍范式:同一组件内许多邻近像素仍被视为有效。精确几何构建打破了这一假设:操作必须落在连续画布空间中的点上,而非容忍区域。由于几何图元携带本体依赖,局部坐标错误会引发级联拓扑失败,扭曲下游对象并使最终构建失效。我们将这一场景界定为精度敏感GUI任务,它要求点级精度、几何感知验证,以及对依赖驱动误差传播的鲁棒性。为对其进行基准测试,我们提出PAGE Bench,包含4,906道题目和超过224K个带过程监督的像素级GUI操作。我们进一步提出PAGER,一个拓扑感知智能体,将构建任务分解为依赖结构化规划与像素级执行。像素接地的监督微调建立可执行的动作语法,而精度对齐的强化学习通过状态条件化的几何反馈缓解rollout引发的曝光偏差。实验揭示了显著的语义-执行鸿沟:通用多模态模型的动作类型准确率可超过88%,但任务成功率仍低于6%。PAGER弥合了这一鸿沟,任务成功率比被评估的最强通用基线高4.1倍,并将步骤成功率从GUI专用智能体的不足9%提升到62%以上,为点精确GUI控制确立了新的最优水平。
