论文
从自身学习点击何处:GUI Grounding的在策略自蒸馏
Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding
摘要
图形用户界面(GUI)grounding将自然语言指令映射到目标元素的视觉坐标,是自主GUI agent的核心能力。近期的强化学习方法(如GRPO)取得了强劲性能,但它们依赖代价高昂的多次采样(rollout),且在困难样本上信号稀疏。这些局限使得在策略自蒸馏(on-policy self-distillation,OPSD)——从单次采样即可提供密集的token级监督——成为有前景的替代方案。然而,其在GUI grounding上的适用性尚未被探索。本文提出GUI-SD,首个专为GUI grounding设计的OPSD框架。首先,它利用目标边界框和高斯软掩码为教师构建视觉增强的特权上下文,在不泄露精确坐标的情况下提供有信息量的引导。其次,它采用熵引导蒸馏,根据数位重要性和教师置信度自适应地为token加权,将优化集中在最具影响力和最可靠的位置。在六个代表性GUI grounding基准上的大量实验表明,GUI-SD在准确率和训练效率上均持续优于基于GRPO的方法和朴素OPSD。代码与训练数据见 https://zhangyan-ucas.github.io/GUI-SD/
