论文

从自身学习点击何处:GUI Grounding的在策略自蒸馏

Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding

摘要

图形用户界面(GUI)grounding将自然语言指令映射到目标元素的视觉坐标,是自主GUI agent的核心能力。近期的强化学习方法(如GRPO)取得了强劲性能,但它们依赖代价高昂的多次采样(rollout),且在困难样本上信号稀疏。这些局限使得在策略自蒸馏(on-policy self-distillation,OPSD)——从单次采样即可提供密集的token级监督——成为有前景的替代方案。然而,其在GUI grounding上的适用性尚未被探索。本文提出GUI-SD,首个专为GUI grounding设计的OPSD框架。首先,它利用目标边界框和高斯软掩码为教师构建视觉增强的特权上下文,在不泄露精确坐标的情况下提供有信息量的引导。其次,它采用熵引导蒸馏,根据数位重要性和教师置信度自适应地为token加权,将优化集中在最具影响力和最可靠的位置。在六个代表性GUI grounding基准上的大量实验表明,GUI-SD在准确率和训练效率上均持续优于基于GRPO的方法和朴素OPSD。代码与训练数据见 https://zhangyan-ucas.github.io/GUI-SD/

从自身学习点击何处:GUI Grounding的在策略自蒸馏:论文配图
图 3:GUI-SD 框架概述。 (a) 教师分支接收特权上下文 xp​r​ix_{pri},它使用目标边界框、高斯软掩码和提示提示来增强学生的原始输入 xx,而学生分支仅对原始上下文进行操作。 (b) GUI-SD 使用教师和学生令牌分布之间的加权反向 KL 目标来训练学生,其中令牌权重 w⁡(t)w(t) 通过位置信用分配优先考虑高阶令牌,并通过熵门控监督过滤不可靠的监督。